黑猫工具
免费 · 无需注册 · 本地运算

Robots.txt 生成器

robots.txt 是放在网站根目录的纯文本文件,用来告诉搜索引擎爬虫哪些目录可以抓取、哪些应当禁止。 本工具面向站长、SEO 优化人员与网站管理员,可视化配置 User-agent、 Allow、 Disallow、 Crawl-delay 与 Sitemap, 实时生成可直接使用的规则文件。

  • 一键屏蔽 GPTBot 等 AI 爬虫
  • WordPress / 博客 / 商城预设
  • 代码高亮 · 一键复制下载
1

配置爬虫规则

快捷预设模板(点击一键填充)



表单修改后会自动实时预览,无需重复点击

2

生成结果

语法速览

  • User-agent: 指定规则作用于哪个爬虫,* 表示全部爬虫
  • Disallow: 禁止抓取的目录或文件,/ 代表整站
  • Allow: 允许抓取,用于覆盖父目录的 Disallow(路径越长优先级越高)
  • Crawl-delay: 两次抓取之间的间隔秒数(部分搜索引擎支持)
  • Sitemap: 网站地图完整地址,需带协议头 https://

所有运算均在你的浏览器本地完成,不向任何服务器提交数据。

robots.txt 常见问题

关于 robots.txt 的作用、部署位置以及与 noindex 的区别,一次讲清楚。

robots.txt 是什么?

robots.txt 是放在网站根目录下的纯文本文件,属于 Robots 排除协议。它用来告诉搜索引擎爬虫哪些目录或页面可以抓取、哪些禁止抓取。注意它是网站与爬虫之间的约定,并非强制性的安全手段,重要内容仍应通过权限或登录保护。

robots.txt 应该放在哪个目录?

必须放在网站根目录,即通过 https://你的域名/robots.txt 可以直接访问。放在子目录(例如 /blog/robots.txt)只对该子目录生效,主流爬虫只会读取根目录的那一份。

robots.txt 和 noindex 有什么区别?

两者控制的目标不同:robots.txt 决定能不能抓取,meta noindex 决定能不能被收录。如果只是不想让某个页面出现在搜索结果里,应使用 noindex 标签;用 robots.txt 屏蔽该页面反而会让爬虫读不到 noindex,可能出现“已屏蔽但仍被收录”的情况。

屏蔽 GPTBot、ClaudeBot 等 AI 爬虫真的有效吗?

对遵守协议的 AI 爬虫有效。使用上方「屏蔽 AI 爬虫」预设,会自动为 GPTBot、ClaudeBot、CCBot、Google-Extended、PerplexityBot 等写入 Disallow: /。但 robots.txt 属于自愿遵守的协议,无法阻止不守规则的采集程序。

Crawl-delay 抓取延迟所有搜索引擎都支持吗?

不是。Crawl-delay 目前主要被 Bing、Yandex 等支持,Google 官方已不支持该指令,建议改用 Search Console 里的抓取速度设置。因此本工具中这一项是可选的,留空不影响最终结果。

修改 robots.txt 后多久生效?

爬虫通常会在下次抓取时重新读取 robots.txt,一般几小时到几天不等。若需加速,可在 Google Search Console 或 Bing 网站管理员工具中提交 robots.txt 并请求重新抓取。

已复制