Robots.txt 生成器 - 在线生成爬虫规则和 Sitemap 声明
在线生成 robots.txt 爬虫规则和 Sitemap 声明,适合配置搜索引擎抓取范围、屏蔽测试路径和规范站点地图入口。
功能特点
- 生成 User-agent、Allow、Disallow 和 Sitemap 等常见 robots.txt 规则
- 辅助控制搜索引擎可抓取路径,避免测试页和重复页被收录
- 支持为站点声明 sitemap.xml 地址,帮助搜索引擎发现页面
- 适合网站上线、SEO 调整和爬虫抓取策略整理
使用方法
- 填写需要允许或禁止抓取的路径规则
- 添加站点 Sitemap 地址并生成 robots.txt 内容
- 将结果发布到网站根目录并用搜索引擎工具检查可抓取性
示例输入
允许全站并声明 Sitemap
User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml适合公开内容站点的基础 robots.txt 配置。
屏蔽后台路径
User-agent: * Disallow: /admin/ Disallow: /api/private/适合阻止常规爬虫抓取后台和私有接口路径,但不等于访问控制。
排查误屏蔽
User-agent: * Disallow: / Sitemap: https://example.com/sitemap.xml适合识别导致整个站点无法抓取的高风险规则。
多行规则生成
User-agent: Googlebot Allow: /public Disallow: /private Sitemap: https://example.com/sitemap.xml页面会逐行 trim 并过滤空行,再按 User-agent、Allow、Disallow、Sitemap 顺序生成文本。
示例输出
允许全站并声明 Sitemap
有效:所有爬虫可抓取根路径;Sitemap 指向 https://example.com/sitemap.xml屏蔽后台路径
有效:所有爬虫被禁止抓取 /admin/ 与 /api/private/ 路径排查误屏蔽
高风险:Disallow: / 会阻止遵守规则的爬虫抓取全站多行规则生成
User-agent: Googlebot Allow: /public Disallow: /private Sitemap: https://example.com/sitemap.xml
常见错误
- robots.txt 只能表达爬虫抓取建议,不能保护后台、API、文件或敏感数据。
- Disallow: / 会阻止大部分路径抓取,发布前必须检查是否误伤公开页面。
- robots.txt 的 Sitemap 地址必须是可访问的绝对 URL,且 sitemap 内容要与真实站点一致。
- robots.txt 不一定能阻止 URL 出现在搜索结果中,敏感页面应使用认证、权限或 noindex 等完整方案。
适用场景
- 站点爬虫规则生成
- 后台路径抓取控制
- 误屏蔽排查
- Sitemap 声明配置
实操检查
验证多行 trim 和输出顺序
固定输入:User-agent=`Googlebot`,Allow=` /public /docs `,Disallow=` /private `,Sitemap=` https://example.com/sitemap.xml `。步骤:点击“生成 Robots.txt”。预期结果:输出依次为 User-agent、两个 Allow、一个 Disallow、一个 Sitemap,空行被过滤且首尾空格被移除。失败判断:空行保留、顺序改变、行内空格未 trim,或 Sitemap 出现多余空格。
验证空值回退
固定输入:User-agent 为空,Allow=`/`,Disallow 为空,Sitemap 为空。步骤:点击“生成 Robots.txt”。预期结果:输出只有 `User-agent: *` 和 `Allow: /` 两行。失败判断:User-agent 为空、出现 `Disallow:` 空行,或生成了没有输入的 Sitemap 行。
页面专属核验
使用前与操作中
- 分别确认 User-agent、Allow、Disallow 和 Sitemap 输入;多行 Allow/Disallow 会按行 trim、过滤空行,并按固定顺序生成文本。
- 把 `Disallow: /`、后台路径和公开路径逐项对照,不能用 robots.txt 代替认证、授权或敏感数据保护;空 User-agent 会回退为 `*`。
- 把页面生成的 robots.txt 文本与线上真实抓取分开核验:工具不请求 URL、不验证爬虫实现或缓存;Open Graph 社交预览也要单独检查页面 head 和平台抓取。
结果出来后
- User-agent=`Googlebot`、Allow=`/public`、Disallow=`/private`、Sitemap=`https://example.com/sitemap.xml` 时,输出是否按 User-agent、Allow、Disallow、Sitemap 顺序逐行生成?
- User-agent、Sitemap 为空且 Allow=`/` 时,是否只得到 `User-agent: *` 和 `Allow: /`,没有空的 Disallow 或 Sitemap 行?
- 发布后是否另外用 HTTP 请求和目标搜索引擎工具确认 `/robots.txt` 的状态码、Content-Type、实际版本及规则效果,而不是把文本生成成功当作已被抓取?
相关工具
- Sitemap XML 生成 / 校验:根据 URL 列表生成 Sitemap XML,并读取其中的 URL
- Open Graph / Meta Tag:生成 SEO、Open Graph 和 Twitter Card 页面元标签
- HTTP 状态码:查询 HTTP 状态码含义、分类和常见排查方向
- HTTP Headers 解析:解析 HTTP Headers,并用 AI 分析认证方式、风险和 API 调试线索
工具边界
- robots.txt 不是安全边界,也不能防止恶意爬虫、数据泄露或未授权访问。
- 不同爬虫对规则、通配符和缓存的支持可能不同。
- 不应把 robots.txt 当作隐藏内部 URL 或删除已公开内容的唯一手段。
与相似工具的区别
- Sitemap XML 生成 / 校验:robots.txt 告诉遵守规则的爬虫哪些路径不要抓取;Sitemap 主动列出希望发现的 canonical URL。
安全与兼容性
- 规则检查在本地完成;robots.txt 内容本身公开可见,不能用它隐藏后台、密钥、备份或敏感路径。
- 上线前应从站点根路径验证 200 响应、纯文本 MIME 和最终规则,错误的 Disallow: / 会造成全站抓取中断。
下一步排查
- 先用 HTTP 状态工具确认 robots.txt 返回 200、纯文本和正确路径。
- 再检查公开页面是否被 Disallow 意外覆盖,并核对 Sitemap URL。
- 敏感内容改用认证、权限控制和必要的 noindex/删除流程。
常见问题
Disallow 能保护敏感接口吗?
不能。它只是给遵守规则的爬虫看的建议,任何客户端仍可直接访问;敏感接口必须使用认证和服务端权限控制。
robots.txt 修改后多久生效?
取决于搜索引擎缓存和重新抓取时间;可在搜索引擎站长工具中查看最新抓取版本。