# robots.txt 生成器使用教程：可视化配置爬虫规则，一键生成下载

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/robots-txt-generator-guide

## 工具简介

**robots.txt 生成器**是工具派推出的一款可视化 SEO 辅助工具：不用背诵 robots 协议语法，只要在页面上填一填表单，右侧就能实时生成一份规范的 `robots.txt` 文件，支持一键复制或直接下载。它把 robots.txt 的核心概念——User-agent 规则组、Allow/Disallow 路径、Crawl-delay、Sitemap、Host——全部做成了表单控件，还内置「允许全部」「禁止全部」「SEO 推荐」「拦截 AI 爬虫」「WordPress」五个常用预设，点一下就能套用成熟方案。工具自带重复 User-agent 提醒、路径自动补全和 URL 合法性校验，全程在浏览器本地运行，打开即用、无需登录。

## 功能亮点

- **多 User-agent 规则组**：可添加任意多个规则组，每组针对一个爬虫（如 `Googlebot`、`*`），组与组之间可上下排序、单独删除，精准控制不同爬虫的抓取行为。
- **Allow / Disallow 路径规则**：每组内可添加多条规则，下拉选择 Allow 或 Disallow，填写路径即可；规则同样支持排序和删除，顺序即匹配优先级。
- **五个常用预设**：允许全部、禁止全部、SEO 推荐（屏蔽 /admin/、/private/、/api/ 等后台路径）、拦截 AI 爬虫（屏蔽 GPTBot、ClaudeBot、Bytespider、Google-Extended 等）、WordPress 专用规则，一键套用。
- **Sitemap 与 Host 声明**：可添加多个 Sitemap 地址，非法 URL 会被自动忽略并红框提示；Host 字段（Yandex 专用）填入完整网址后自动提取域名输出。
- **Crawl-delay 与注释**：每组可设置抓取间隔秒数，还可写一行注释，生成时会以 `#` 注释行出现在文件中，方便日后维护。
- **智能校验提醒**：User-agent 留空会红字提示且禁用下载；多个组使用相同 User-agent 时弹出黄色提醒（爬虫只匹配第一个组）；路径未以 `/` 开头时红框提示并在生成时自动补全。
- **实时预览 + 一键导出**：右侧代码区随编辑实时刷新，顶部带生成来源注释；「复制」按钮拷走全文，「下载 robots.txt」直接保存为标准文件，上传到网站根目录即可生效。

## 参数说明

| 参数 | 说明 | 默认值 / 取值范围 |
| --- | --- | --- |
| 快速预设 | 一键套用常用 robots.txt 方案 | 允许全部 / 禁止全部 / SEO 推荐 / 拦截 AI 爬虫 / WordPress |
| User-agent | 规则组针对的爬虫标识，`*` 表示所有爬虫 | 默认 `*`，必填，留空时禁止下载 |
| Crawl-delay（秒） | 该爬虫两次抓取之间的间隔秒数（Googlebot 不识别此指令） | 默认留空（不输出），≥0 的数字才生效 |
| 注释 | 规则组的说明文字 | 默认留空，填写后以 `# 注释` 行输出 |
| 规则类型 | 单条规则是允许还是禁止抓取 | Allow 或 Disallow，新增规则默认 Disallow |
| 规则路径 | 要允许/禁止的 URL 路径，支持 `*` 通配符（如 `/*?s=`） | 留空生成时按 `/` 处理；未以 `/` 开头自动补全 |
| Host | 声明站点主域名（Yandex 专用） | 默认留空，须为合法 URL，输出时只取域名部分 |
| Sitemap | 站点地图地址，可添加多条 | 默认 1 条空行，仅合法 URL 会被输出 |

## 使用步骤

1. **打开工具页面**：上方是工具标题和「快速预设」栏，左侧是规则组编辑区，右侧是实时预览区，无需登录即可使用。

![robots.txt 生成器主界面：顶部为工具标题与说明，其下是「快速预设」栏（允许全部、禁止全部、SEO 推荐、拦截 ](article/202607/1783995028138_9976.png)

2. **套用预设（可选）**：不想从零配置时，直接点「快速预设」——新站上线前可点「禁止全部」临时封站，正式站点点「SEO 推荐」屏蔽后台路径，WordPress 站点点「WordPress」即可得到一整套成熟规则。

3. **配置规则组**：在「规则组」卡片中填写 User-agent（`*` 代表所有爬虫，也可填 `Googlebot` 等具体爬虫），按需填写 Crawl-delay 秒数和注释；点「添加规则」增加 Allow/Disallow 条目，用 ↑↓ 调整顺序、× 删除。

4. **添加更多规则组（可选）**：点「+ 添加 User-agent 规则组」可为不同爬虫制定不同策略，例如单独给 `Baiduspider` 设一组规则，其余爬虫走 `*` 组。注意爬虫只匹配第一个命中的组，请把具体爬虫的组排在通配组之前。

5. **填写 Sitemap 与 Host（可选）**：在 Sitemap 区域填入站点地图完整地址（如 `https://example.com/sitemap.xml`），可点「添加 Sitemap」增加多条；使用 Yandex 的站点可在 Host 中填写主站网址。

6. **复制或下载使用**：右侧预览区会实时生成带注释的标准 robots.txt 文本，确认无误后点「复制」粘贴到自己的文件，或点「下载 robots.txt」直接保存，然后上传到网站根目录（`https://你的域名/robots.txt`）即可生效。

## 使用技巧

- **先预设再微调**：五个预设覆盖了绝大多数场景，最省事的用法是先点一个最接近的预设，再增删几条规则，而不是从空白开始逐条添加。
- **善用通配符屏蔽参数页**：路径支持 `*` 通配符，例如 `Disallow: /*?s=` 可屏蔽站内搜索结果页，`Disallow: /*?utm_` 可屏蔽带推广参数的重复页面，避免浪费抓取配额。
- **具体爬虫的组要排在前面**：爬虫按规则组顺序匹配，命中第一个组后就不再看后面的组，所以 `Googlebot` 这样的专属组必须放在 `*` 通配组之前，工具也会对重复 User-agent 给出黄色提醒。
- **拦截 AI 训练用「拦截 AI 爬虫」预设**：该预设已内置 GPTBot、ClaudeBot、Bytespider、Google-Extended 等主流 AI 爬虫的屏蔽规则，不想被拿去训练模型时一键套用即可。
- **Crawl-delay 对 Googlebot 无效**：Google 不识别 Crawl-delay 指令，需要限制 Google 抓取频率时应去 Google Search Console 设置，该字段主要对 Bing、Yandex 等爬虫有效。
- **上线前记得改回来**：用「禁止全部」临时封站的站点，正式上线后务必改回允许抓取的规则，否则搜索引擎会一直拒绝收录。

## 常见问题

**Q1：生成的 robots.txt 应该放在哪里？**
放在网站根目录，保证能通过 `https://你的域名/robots.txt` 直接访问到。爬虫抓取任何页面前都会先请求这个固定路径，放在子目录里是无效的。

**Q2：Disallow 路径留空是什么意思？**
`Disallow:` 后不带任何路径表示「不禁止任何内容」，即允许全部抓取。工具中如果一个规则组没有任何规则，生成时就会自动输出空 Disallow，等效于放行。

**Q3：多个规则组都写了 `*` 会怎么样？**
爬虫只会使用第一个匹配到的 User-agent 组，后面的同名片段会被忽略。工具检测到重复 User-agent 时会显示黄色提醒，建议合并成一组或删除多余组。

**Q4：Crawl-delay 设了为什么不生效？**
Crawl-delay 不是所有爬虫都支持：Bing、Yandex 等会遵守，但 Googlebot 完全忽略该指令。要控制 Google 的抓取频率，只能在 Google Search Console 中调整。

**Q5：Host 字段有什么用？必须填吗？**
Host 用于声明站点主域名（如带不带 www），目前只有 Yandex 识别该指令，不面向 Yandex 的站点可以不填。填写时需输入完整网址（含 `https://`），生成时会自动只保留域名部分。

**Q6：robots.txt 能彻底阻止别人抓取我的页面吗？**
不能。robots.txt 只是给守规矩的正规爬虫看的「君子协定」，恶意爬虫可以完全无视它。涉及隐私或安全的内容应通过登录鉴权、服务器访问控制等手段保护，而不是依赖 robots.txt。

