robots.txt 生成器使用教程:可视化配置爬虫规则,一键生成下载

robots.txt 生成器使用教程:可视化配置爬虫规则,一键生成下载

📁 开发👁️ 147 阅读⏱️ 6 分钟阅读🕒 2026/9/14

免费在线 robots.txt 生成器,可视化配置 User-agent 规则组、Allow/Disallow 路径、Crawl-delay、Sitemap 与 Host,内置 SEO 推荐、拦截 AI 爬虫、WordPress 等预设,一键复制或下载。

工具简介

robots.txt 生成器是工具派推出的一款可视化 SEO 辅助工具:不用背诵 robots 协议语法,只要在页面上填一填表单,右侧就能实时生成一份规范的 robots.txt 文件,支持一键复制或直接下载。它把 robots.txt 的核心概念——User-agent 规则组、Allow/Disallow 路径、Crawl-delay、Sitemap、Host——全部做成了表单控件,还内置「允许全部」「禁止全部」「SEO 推荐」「拦截 AI 爬虫」「WordPress」五个常用预设,点一下就能套用成熟方案。工具自带重复 User-agent 提醒、路径自动补全和 URL 合法性校验,全程在浏览器本地运行,打开即用、无需登录。

功能亮点

  • 多 User-agent 规则组:可添加任意多个规则组,每组针对一个爬虫(如 Googlebot*),组与组之间可上下排序、单独删除,精准控制不同爬虫的抓取行为。
  • Allow / Disallow 路径规则:每组内可添加多条规则,下拉选择 Allow 或 Disallow,填写路径即可;规则同样支持排序和删除,顺序即匹配优先级。
  • 五个常用预设:允许全部、禁止全部、SEO 推荐(屏蔽 /admin/、/private/、/api/ 等后台路径)、拦截 AI 爬虫(屏蔽 GPTBot、ClaudeBot、Bytespider、Google-Extended 等)、WordPress 专用规则,一键套用。
  • Sitemap 与 Host 声明:可添加多个 Sitemap 地址,非法 URL 会被自动忽略并红框提示;Host 字段(Yandex 专用)填入完整网址后自动提取域名输出。
  • Crawl-delay 与注释:每组可设置抓取间隔秒数,还可写一行注释,生成时会以 # 注释行出现在文件中,方便日后维护。
  • 智能校验提醒:User-agent 留空会红字提示且禁用下载;多个组使用相同 User-agent 时弹出黄色提醒(爬虫只匹配第一个组);路径未以 / 开头时红框提示并在生成时自动补全。
  • 实时预览 + 一键导出:右侧代码区随编辑实时刷新,顶部带生成来源注释;「复制」按钮拷走全文,「下载 robots.txt」直接保存为标准文件,上传到网站根目录即可生效。

参数说明

参数 说明 默认值 / 取值范围
快速预设 一键套用常用 robots.txt 方案 允许全部 / 禁止全部 / SEO 推荐 / 拦截 AI 爬虫 / WordPress
User-agent 规则组针对的爬虫标识,* 表示所有爬虫 默认 *,必填,留空时禁止下载
Crawl-delay(秒) 该爬虫两次抓取之间的间隔秒数(Googlebot 不识别此指令) 默认留空(不输出),≥0 的数字才生效
注释 规则组的说明文字 默认留空,填写后以 # 注释 行输出
规则类型 单条规则是允许还是禁止抓取 Allow 或 Disallow,新增规则默认 Disallow
规则路径 要允许/禁止的 URL 路径,支持 * 通配符(如 /*?s= 留空生成时按 / 处理;未以 / 开头自动补全
Host 声明站点主域名(Yandex 专用) 默认留空,须为合法 URL,输出时只取域名部分
Sitemap 站点地图地址,可添加多条 默认 1 条空行,仅合法 URL 会被输出

使用步骤

  1. 打开工具页面:上方是工具标题和「快速预设」栏,左侧是规则组编辑区,右侧是实时预览区,无需登录即可使用。

robots.txt 生成器主界面:顶部为工具标题与说明,其下是「快速预设」栏(允许全部、禁止全部、SEO 推荐、拦截

  1. 套用预设(可选):不想从零配置时,直接点「快速预设」——新站上线前可点「禁止全部」临时封站,正式站点点「SEO 推荐」屏蔽后台路径,WordPress 站点点「WordPress」即可得到一整套成熟规则。

  2. 配置规则组:在「规则组」卡片中填写 User-agent(* 代表所有爬虫,也可填 Googlebot 等具体爬虫),按需填写 Crawl-delay 秒数和注释;点「添加规则」增加 Allow/Disallow 条目,用 ↑↓ 调整顺序、× 删除。

  3. 添加更多规则组(可选):点「+ 添加 User-agent 规则组」可为不同爬虫制定不同策略,例如单独给 Baiduspider 设一组规则,其余爬虫走 * 组。注意爬虫只匹配第一个命中的组,请把具体爬虫的组排在通配组之前。

  4. 填写 Sitemap 与 Host(可选):在 Sitemap 区域填入站点地图完整地址(如 https://example.com/sitemap.xml),可点「添加 Sitemap」增加多条;使用 Yandex 的站点可在 Host 中填写主站网址。

  5. 复制或下载使用:右侧预览区会实时生成带注释的标准 robots.txt 文本,确认无误后点「复制」粘贴到自己的文件,或点「下载 robots.txt」直接保存,然后上传到网站根目录(https://你的域名/robots.txt)即可生效。

使用技巧

  • 先预设再微调:五个预设覆盖了绝大多数场景,最省事的用法是先点一个最接近的预设,再增删几条规则,而不是从空白开始逐条添加。
  • 善用通配符屏蔽参数页:路径支持 * 通配符,例如 Disallow: /*?s= 可屏蔽站内搜索结果页,Disallow: /*?utm_ 可屏蔽带推广参数的重复页面,避免浪费抓取配额。
  • 具体爬虫的组要排在前面:爬虫按规则组顺序匹配,命中第一个组后就不再看后面的组,所以 Googlebot 这样的专属组必须放在 * 通配组之前,工具也会对重复 User-agent 给出黄色提醒。
  • 拦截 AI 训练用「拦截 AI 爬虫」预设:该预设已内置 GPTBot、ClaudeBot、Bytespider、Google-Extended 等主流 AI 爬虫的屏蔽规则,不想被拿去训练模型时一键套用即可。
  • Crawl-delay 对 Googlebot 无效:Google 不识别 Crawl-delay 指令,需要限制 Google 抓取频率时应去 Google Search Console 设置,该字段主要对 Bing、Yandex 等爬虫有效。
  • 上线前记得改回来:用「禁止全部」临时封站的站点,正式上线后务必改回允许抓取的规则,否则搜索引擎会一直拒绝收录。

常见问题

Q1:生成的 robots.txt 应该放在哪里?
放在网站根目录,保证能通过 https://你的域名/robots.txt 直接访问到。爬虫抓取任何页面前都会先请求这个固定路径,放在子目录里是无效的。

Q2:Disallow 路径留空是什么意思?
Disallow: 后不带任何路径表示「不禁止任何内容」,即允许全部抓取。工具中如果一个规则组没有任何规则,生成时就会自动输出空 Disallow,等效于放行。

**Q3:多个规则组都写了 * 会怎么样?**爬虫只会使用第一个匹配到的 User-agent 组,后面的同名片段会被忽略。工具检测到重复 User-agent 时会显示黄色提醒,建议合并成一组或删除多余组。**Q4:Crawl-delay 设了为什么不生效?**Crawl-delay 不是所有爬虫都支持:Bing、Yandex 等会遵守,但 Googlebot 完全忽略该指令。要控制 Google 的抓取频率,只能在 Google Search Console 中调整。**Q5:Host 字段有什么用?必须填吗?**Host 用于声明站点主域名(如带不带 www),目前只有 Yandex 识别该指令,不面向 Yandex 的站点可以不填。填写时需输入完整网址(含 https://),生成时会自动只保留域名部分。Q6:robots.txt 能彻底阻止别人抓取我的页面吗?
不能。robots.txt 只是给守规矩的正规爬虫看的「君子协定」,恶意爬虫可以完全无视它。涉及隐私或安全的内容应通过登录鉴权、服务器访问控制等手段保护,而不是依赖 robots.txt。