Robots.txt 生成器 - 在线生成爬虫规则和 Sitemap 声明

在线生成 robots.txt 爬虫规则和 Sitemap 声明,适合配置搜索引擎抓取范围、屏蔽测试路径和规范站点地图入口。

功能特点

  • 生成 User-agent、Allow、Disallow 和 Sitemap 等常见 robots.txt 规则
  • 辅助控制搜索引擎可抓取路径,避免测试页和重复页被收录
  • 支持为站点声明 sitemap.xml 地址,帮助搜索引擎发现页面
  • 适合网站上线、SEO 调整和爬虫抓取策略整理

使用方法

  1. 填写需要允许或禁止抓取的路径规则
  2. 添加站点 Sitemap 地址并生成 robots.txt 内容
  3. 将结果发布到网站根目录并用搜索引擎工具检查可抓取性

示例输入

  • 允许全站并声明 Sitemap

    User-agent: *
    Allow: /
    
    Sitemap: https://example.com/sitemap.xml

    适合公开内容站点的基础 robots.txt 配置。

  • 屏蔽后台路径

    User-agent: *
    Disallow: /admin/
    Disallow: /api/private/

    适合阻止常规爬虫抓取后台和私有接口路径,但不等于访问控制。

  • 排查误屏蔽

    User-agent: *
    Disallow: /
    
    Sitemap: https://example.com/sitemap.xml

    适合识别导致整个站点无法抓取的高风险规则。

  • 多行规则生成

    User-agent: Googlebot
    Allow: /public
    Disallow: /private
    Sitemap: https://example.com/sitemap.xml

    页面会逐行 trim 并过滤空行,再按 User-agent、Allow、Disallow、Sitemap 顺序生成文本。

示例输出

  • 允许全站并声明 Sitemap

    有效:所有爬虫可抓取根路径;Sitemap 指向 https://example.com/sitemap.xml
  • 屏蔽后台路径

    有效:所有爬虫被禁止抓取 /admin/ 与 /api/private/ 路径
  • 排查误屏蔽

    高风险:Disallow: / 会阻止遵守规则的爬虫抓取全站
  • 多行规则生成

    User-agent: Googlebot
    Allow: /public
    Disallow: /private
    Sitemap: https://example.com/sitemap.xml

常见错误

  • robots.txt 只能表达爬虫抓取建议,不能保护后台、API、文件或敏感数据。
  • Disallow: / 会阻止大部分路径抓取,发布前必须检查是否误伤公开页面。
  • robots.txt 的 Sitemap 地址必须是可访问的绝对 URL,且 sitemap 内容要与真实站点一致。
  • robots.txt 不一定能阻止 URL 出现在搜索结果中,敏感页面应使用认证、权限或 noindex 等完整方案。

适用场景

  • 站点爬虫规则生成
  • 后台路径抓取控制
  • 误屏蔽排查
  • Sitemap 声明配置

实操检查

  • 验证多行 trim 和输出顺序

    固定输入:User-agent=`Googlebot`,Allow=` /public /docs `,Disallow=` /private `,Sitemap=` https://example.com/sitemap.xml `。步骤:点击“生成 Robots.txt”。预期结果:输出依次为 User-agent、两个 Allow、一个 Disallow、一个 Sitemap,空行被过滤且首尾空格被移除。失败判断:空行保留、顺序改变、行内空格未 trim,或 Sitemap 出现多余空格。

  • 验证空值回退

    固定输入:User-agent 为空,Allow=`/`,Disallow 为空,Sitemap 为空。步骤:点击“生成 Robots.txt”。预期结果:输出只有 `User-agent: *` 和 `Allow: /` 两行。失败判断:User-agent 为空、出现 `Disallow:` 空行,或生成了没有输入的 Sitemap 行。

页面专属核验

使用前与操作中

  • 分别确认 User-agent、Allow、Disallow 和 Sitemap 输入;多行 Allow/Disallow 会按行 trim、过滤空行,并按固定顺序生成文本。
  • 把 `Disallow: /`、后台路径和公开路径逐项对照,不能用 robots.txt 代替认证、授权或敏感数据保护;空 User-agent 会回退为 `*`。
  • 把页面生成的 robots.txt 文本与线上真实抓取分开核验:工具不请求 URL、不验证爬虫实现或缓存;Open Graph 社交预览也要单独检查页面 head 和平台抓取。

结果出来后

  • User-agent=`Googlebot`、Allow=`/public`、Disallow=`/private`、Sitemap=`https://example.com/sitemap.xml` 时,输出是否按 User-agent、Allow、Disallow、Sitemap 顺序逐行生成?
  • User-agent、Sitemap 为空且 Allow=`/` 时,是否只得到 `User-agent: *` 和 `Allow: /`,没有空的 Disallow 或 Sitemap 行?
  • 发布后是否另外用 HTTP 请求和目标搜索引擎工具确认 `/robots.txt` 的状态码、Content-Type、实际版本及规则效果,而不是把文本生成成功当作已被抓取?

相关工具

工具边界

  • robots.txt 不是安全边界,也不能防止恶意爬虫、数据泄露或未授权访问。
  • 不同爬虫对规则、通配符和缓存的支持可能不同。
  • 不应把 robots.txt 当作隐藏内部 URL 或删除已公开内容的唯一手段。

与相似工具的区别

  • Sitemap XML 生成 / 校验:robots.txt 告诉遵守规则的爬虫哪些路径不要抓取;Sitemap 主动列出希望发现的 canonical URL。

安全与兼容性

  • 规则检查在本地完成;robots.txt 内容本身公开可见,不能用它隐藏后台、密钥、备份或敏感路径。
  • 上线前应从站点根路径验证 200 响应、纯文本 MIME 和最终规则,错误的 Disallow: / 会造成全站抓取中断。

下一步排查

  1. 先用 HTTP 状态工具确认 robots.txt 返回 200、纯文本和正确路径。
  2. 再检查公开页面是否被 Disallow 意外覆盖,并核对 Sitemap URL。
  3. 敏感内容改用认证、权限控制和必要的 noindex/删除流程。

常见问题

Disallow 能保护敏感接口吗?

不能。它只是给遵守规则的爬虫看的建议,任何客户端仍可直接访问;敏感接口必须使用认证和服务端权限控制。

robots.txt 修改后多久生效?

取决于搜索引擎缓存和重新抓取时间;可在搜索引擎站长工具中查看最新抓取版本。