robots.txt 生成器

生成 robots.txt,含 AI 爬虫准入配置

浏览器内运算Robots.txt Generator工具型07网络与 Web

什么是robots.txt 生成器

robots.txt 生成器在常规抓取规则之外,专门提供 AI 爬虫准入配置:可分别放行或拒绝 OAI-SearchBot、PerplexityBot、Claude-SearchBot 等检索型爬虫与纯采集器。生成在浏览器本地完成。

怎么用robots.txt 生成器

  1. 1填写站点地图地址与需要屏蔽的路径。
  2. 2点击 AI 爬虫标签切换放行状态,高亮表示放行。
  3. 3复制内容保存为站点根目录的 robots.txt。
  4. 4上线后用搜索引擎的 robots 测试工具验证。

常见问题

AI 爬虫应该放行还是屏蔽?+

取决于你要什么。检索型爬虫(OAI-SearchBot、PerplexityBot、Claude-SearchBot)决定你的内容能否被 AI 回答引用并带来曝光,通常应放行;纯训练或采集型爬虫抓取量大但几乎不带来引用,带宽敏感时可以拒绝。

robots.txt 能阻止所有 AI 抓取吗?+

不能。它是一份自愿遵守的协议,主流爬虫会遵守,但部分「代理型」User-Agent 被其厂商定义为代表真人的实时请求,明确不受 robots.txt 约束。要真正限制这类流量,必须在 CDN 或服务端做速率限制。

Disallow 能保护敏感页面吗?+

不能,反而更危险。robots.txt 是公开可读的,把 /admin/ 写进去等于告诉所有人后台在哪。敏感内容必须靠鉴权保护,robots.txt 只用于控制抓取预算。

相关工具

全部工具