工具简介
robots.txt 生成器是工具派推出的一款可视化 SEO 辅助工具:不用背诵 robots 协议语法,只要在页面上填一填表单,右侧就能实时生成一份规范的 robots.txt 文件,支持一键复制或直接下载。它把 robots.txt 的核心概念——User-agent 规则组、Allow/Disallow 路径、Crawl-delay、Sitemap、Host——全部做成了表单控件,还内置「允许全部」「禁止全部」「SEO 推荐」「拦截 AI 爬虫」「WordPress」五个常用预设,点一下就能套用成熟方案。工具自带重复 User-agent 提醒、路径自动补全和 URL 合法性校验,全程在浏览器本地运行,打开即用、无需登录。
功能亮点
- 多 User-agent 规则组:可添加任意多个规则组,每组针对一个爬虫(如
Googlebot、*),组与组之间可上下排序、单独删除,精准控制不同爬虫的抓取行为。 - Allow / Disallow 路径规则:每组内可添加多条规则,下拉选择 Allow 或 Disallow,填写路径即可;规则同样支持排序和删除,顺序即匹配优先级。
- 五个常用预设:允许全部、禁止全部、SEO 推荐(屏蔽 /admin/、/private/、/api/ 等后台路径)、拦截 AI 爬虫(屏蔽 GPTBot、ClaudeBot、Bytespider、Google-Extended 等)、WordPress 专用规则,一键套用。
- Sitemap 与 Host 声明:可添加多个 Sitemap 地址,非法 URL 会被自动忽略并红框提示;Host 字段(Yandex 专用)填入完整网址后自动提取域名输出。
- Crawl-delay 与注释:每组可设置抓取间隔秒数,还可写一行注释,生成时会以
#注释行出现在文件中,方便日后维护。 - 智能校验提醒:User-agent 留空会红字提示且禁用下载;多个组使用相同 User-agent 时弹出黄色提醒(爬虫只匹配第一个组);路径未以
/开头时红框提示并在生成时自动补全。 - 实时预览 + 一键导出:右侧代码区随编辑实时刷新,顶部带生成来源注释;「复制」按钮拷走全文,「下载 robots.txt」直接保存为标准文件,上传到网站根目录即可生效。
参数说明
| 参数 | 说明 | 默认值 / 取值范围 |
|---|---|---|
| 快速预设 | 一键套用常用 robots.txt 方案 | 允许全部 / 禁止全部 / SEO 推荐 / 拦截 AI 爬虫 / WordPress |
| User-agent | 规则组针对的爬虫标识,* 表示所有爬虫 |
默认 *,必填,留空时禁止下载 |
| Crawl-delay(秒) | 该爬虫两次抓取之间的间隔秒数(Googlebot 不识别此指令) | 默认留空(不输出),≥0 的数字才生效 |
| 注释 | 规则组的说明文字 | 默认留空,填写后以 # 注释 行输出 |
| 规则类型 | 单条规则是允许还是禁止抓取 | Allow 或 Disallow,新增规则默认 Disallow |
| 规则路径 | 要允许/禁止的 URL 路径,支持 * 通配符(如 /*?s=) |
留空生成时按 / 处理;未以 / 开头自动补全 |
| Host | 声明站点主域名(Yandex 专用) | 默认留空,须为合法 URL,输出时只取域名部分 |
| Sitemap | 站点地图地址,可添加多条 | 默认 1 条空行,仅合法 URL 会被输出 |
使用步骤
- 打开工具页面:上方是工具标题和「快速预设」栏,左侧是规则组编辑区,右侧是实时预览区,无需登录即可使用。

套用预设(可选):不想从零配置时,直接点「快速预设」——新站上线前可点「禁止全部」临时封站,正式站点点「SEO 推荐」屏蔽后台路径,WordPress 站点点「WordPress」即可得到一整套成熟规则。
配置规则组:在「规则组」卡片中填写 User-agent(
*代表所有爬虫,也可填Googlebot等具体爬虫),按需填写 Crawl-delay 秒数和注释;点「添加规则」增加 Allow/Disallow 条目,用 ↑↓ 调整顺序、× 删除。添加更多规则组(可选):点「+ 添加 User-agent 规则组」可为不同爬虫制定不同策略,例如单独给
Baiduspider设一组规则,其余爬虫走*组。注意爬虫只匹配第一个命中的组,请把具体爬虫的组排在通配组之前。填写 Sitemap 与 Host(可选):在 Sitemap 区域填入站点地图完整地址(如
https://example.com/sitemap.xml),可点「添加 Sitemap」增加多条;使用 Yandex 的站点可在 Host 中填写主站网址。复制或下载使用:右侧预览区会实时生成带注释的标准 robots.txt 文本,确认无误后点「复制」粘贴到自己的文件,或点「下载 robots.txt」直接保存,然后上传到网站根目录(
https://你的域名/robots.txt)即可生效。
使用技巧
- 先预设再微调:五个预设覆盖了绝大多数场景,最省事的用法是先点一个最接近的预设,再增删几条规则,而不是从空白开始逐条添加。
- 善用通配符屏蔽参数页:路径支持
*通配符,例如Disallow: /*?s=可屏蔽站内搜索结果页,Disallow: /*?utm_可屏蔽带推广参数的重复页面,避免浪费抓取配额。 - 具体爬虫的组要排在前面:爬虫按规则组顺序匹配,命中第一个组后就不再看后面的组,所以
Googlebot这样的专属组必须放在*通配组之前,工具也会对重复 User-agent 给出黄色提醒。 - 拦截 AI 训练用「拦截 AI 爬虫」预设:该预设已内置 GPTBot、ClaudeBot、Bytespider、Google-Extended 等主流 AI 爬虫的屏蔽规则,不想被拿去训练模型时一键套用即可。
- Crawl-delay 对 Googlebot 无效:Google 不识别 Crawl-delay 指令,需要限制 Google 抓取频率时应去 Google Search Console 设置,该字段主要对 Bing、Yandex 等爬虫有效。
- 上线前记得改回来:用「禁止全部」临时封站的站点,正式上线后务必改回允许抓取的规则,否则搜索引擎会一直拒绝收录。
常见问题
Q1:生成的 robots.txt 应该放在哪里?
放在网站根目录,保证能通过 https://你的域名/robots.txt 直接访问到。爬虫抓取任何页面前都会先请求这个固定路径,放在子目录里是无效的。
Q2:Disallow 路径留空是什么意思?Disallow: 后不带任何路径表示「不禁止任何内容」,即允许全部抓取。工具中如果一个规则组没有任何规则,生成时就会自动输出空 Disallow,等效于放行。
**Q3:多个规则组都写了 * 会怎么样?**爬虫只会使用第一个匹配到的 User-agent 组,后面的同名片段会被忽略。工具检测到重复 User-agent 时会显示黄色提醒,建议合并成一组或删除多余组。**Q4:Crawl-delay 设了为什么不生效?**Crawl-delay 不是所有爬虫都支持:Bing、Yandex 等会遵守,但 Googlebot 完全忽略该指令。要控制 Google 的抓取频率,只能在 Google Search Console 中调整。**Q5:Host 字段有什么用?必须填吗?**Host 用于声明站点主域名(如带不带 www),目前只有 Yandex 识别该指令,不面向 Yandex 的站点可以不填。填写时需输入完整网址(含 https://),生成时会自动只保留域名部分。Q6:robots.txt 能彻底阻止别人抓取我的页面吗?
不能。robots.txt 只是给守规矩的正规爬虫看的「君子协定」,恶意爬虫可以完全无视它。涉及隐私或安全的内容应通过登录鉴权、服务器访问控制等手段保护,而不是依赖 robots.txt。
