什么是Robots.txt生成器?
生成格式规范的robots.txt文件,控制搜索引擎爬虫对网站的访问方式。可添加User-Agent规则、设置允许/禁止路径、指定抓取延迟和站点地图引用,无需手动编写文件。
可以按需要添加任意数量的 user-agent 区块——一个针对 *(所有爬虫),其他分别针对 Googlebot、Bingbot、AhrefsBot、GPTBot 等。每个区块都能列多条 Allow 和 Disallow 路径,以及可选的秒级 Crawl-delay 值。末尾会单独列出每条 Sitemap 链接。输出就是要放到你域名 /robots.txt 路径下的原文。
使用方法
- 添加User-Agent规则(如Googlebot、Bingbot或*代表全部),并指定允许或禁止访问的路径。
- 可选择设置抓取延迟并添加站点地图URL。
- 复制或下载生成的robots.txt文件,上传到网站根目录即可。
何时使用
- 屏蔽 AI 训练爬虫(GPTBot、ClaudeBot、CCBot、Google-Extended),不让它们抓取内容。
- 把后台、站内搜索、预发或内容重复的路径挡在搜索引擎索引之外。
- 网站迁移时把爬虫引到新的 sitemap,或者改版期间临时全站禁爬。
结果
创建规则允许所有爬虫访问网站,但屏蔽/admin/和/api/路径,并声明站点地图地址为https://example.com/sitemap.xml。
常见问题
- robots.txt 真的能阻止爬虫抓取,还是只是友好提议?
- 这是一个自愿遵守的协议。Google、Bing 等主流爬虫和大型归档项目会遵守。爬数据的脚本、恶意爬虫,以及部分灰色地带的 AI 爬虫都不会理。真要做访问控制,请在服务器端做认证,或在边缘按 IP 和 user-agent 拦截。
- Disallow 和 noindex 有什么区别?
- Disallow 是阻止抓取——Google 根本不会下载页面。noindex(meta 标签或 HTTP 头)是即使抓到也不要把它放进搜索结果。被 Disallow 的页面 Google 看不到 noindex,所以这些 URL 还是有可能出现在搜索结果里。
- robots.txt 到底要放在哪个位置?
- 必须放在域名根目录,可通过 https://example.com/robots.txt 访问。子目录或子域名各自需要一份。Next.js 项目放到 /public/robots.txt 即可;Vercel 项目根目录里放一份静态文件也可以。
- 怎么阻止 ChatGPT、Claude 拿我的站点做训练?
- 添加 User-agent: GPTBot、User-agent: ClaudeBot、User-agent: CCBot、User-agent: anthropic-ai、User-agent: Google-Extended,每个下面都加 Disallow: /。注意 Google-Extended 只是不让它训练,Googlebot 仍会正常索引页面。
- Crawl-delay 现在 Google 还认吗?
- 不认了。Google 忽略 Crawl-delay,改在 Search Console 里设抓取速率。Bing、Yandex、Yahoo 仍然遵循这个字段。在这里设的值会保留在文件里,对那些爬虫有效,Google 看到这行直接跳过。