什么是robots.txt 生成器?
robots.txt 生成器在常规抓取规则之外,专门提供 AI 爬虫准入配置:可分别放行或拒绝 OAI-SearchBot、PerplexityBot、Claude-SearchBot 等检索型爬虫与纯采集器。生成在浏览器本地完成。
怎么用robots.txt 生成器?
- 1填写站点地图地址与需要屏蔽的路径。
- 2点击 AI 爬虫标签切换放行状态,高亮表示放行。
- 3复制内容保存为站点根目录的 robots.txt。
- 4上线后用搜索引擎的 robots 测试工具验证。
常见问题
AI 爬虫应该放行还是屏蔽?+
取决于你要什么。检索型爬虫(OAI-SearchBot、PerplexityBot、Claude-SearchBot)决定你的内容能否被 AI 回答引用并带来曝光,通常应放行;纯训练或采集型爬虫抓取量大但几乎不带来引用,带宽敏感时可以拒绝。
robots.txt 能阻止所有 AI 抓取吗?+
不能。它是一份自愿遵守的协议,主流爬虫会遵守,但部分「代理型」User-Agent 被其厂商定义为代表真人的实时请求,明确不受 robots.txt 约束。要真正限制这类流量,必须在 CDN 或服务端做速率限制。
Disallow 能保护敏感页面吗?+
不能,反而更危险。robots.txt 是公开可读的,把 /admin/ 写进去等于告诉所有人后台在哪。敏感内容必须靠鉴权保护,robots.txt 只用于控制抓取预算。