Sitemap XML 生成器 - 在线生成和校验网站地图
在线根据 URL 列表生成 Sitemap XML,并读取和校验 sitemap.xml 中的 URL,适合搜索引擎收录、站点结构整理和 SEO 检查。
功能特点
- 根据页面 URL 列表生成符合规范的 Sitemap XML
- 解析现有 sitemap.xml,快速查看其中包含的 URL
- 辅助检查 canonical、主域名和无尾斜杠 URL 是否保持一致
- 适合网站上线、页面新增和 SEO 技术检查流程
使用方法
- 粘贴需要提交给搜索引擎的页面 URL 列表
- 生成 Sitemap XML 或解析已有 sitemap.xml 内容
- 检查 URL 规范后发布到站点根目录并提交给搜索平台
示例输入
基础 URL 集合
<?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"><url><loc>https://example.com/</loc></url></urlset>适合生成小型站点的 sitemap.xml,并检查 XML 命名空间和 loc 结构。
带更新时间的页面
<url><loc>https://example.com/docs</loc><lastmod>2026-07-21</lastmod><changefreq>weekly</changefreq></url>适合为文档或工具页补充真实更新时间;不要伪造频繁变更。
线上抓取异常
Sitemap URL:https://example.com/sitemap.xml 问题:提交后显示无法读取或 URL 被排除适合按状态码、Content-Type、robots 和 canonical 顺序排查。
XML 特殊字符转义
URL:https://example.com/search?q=a&b=1 lastmod:2026-08-10生成器会转义 loc 中的 & 等 XML 特殊字符;解析验证时再还原 URL 文本。
示例输出
基础 URL 集合
有效 Sitemap;包含 1 个 URL:https://example.com/带更新时间的页面
URL:https://example.com/docs;lastmod=2026-07-21;changefreq=weekly线上抓取异常
诊断清单:确认返回 200、Content-Type、XML 语法、robots 可访问性及 loc 的 canonical 状态XML 特殊字符转义
<loc>https://example.com/search?q=a&b=1</loc> <lastmod>2026-08-10</lastmod> 解析后 URL:https://example.com/search?q=a&b=1
常见错误
- sitemap.xml 必须返回 200、有效 XML 和正确的 Content-Type,不能返回 SPA 404 页面。
- 只应提交可索引的规范 URL,不要把 noindex、参数页、重定向和重复 URL 放进去。
- lastmod 应反映页面真实的重要更新时间,不能每天批量刷新来制造变化。
- Sitemap 只能帮助发现 URL,不能强制搜索引擎收录或替代高质量页面内容。
适用场景
- 工具站 Sitemap 生成
- 新增页面提交
- 搜索引擎抓取排查
- Canonical 与索引 URL 核对
实操检查
验证生成和 XML 转义
固定输入:URL=`https://example.com/search?q=a&b=1`,lastmod=`2026-08-10`。步骤:点击“生成 Sitemap”。预期结果:输出含 XML 声明、urlset 命名空间、`<loc>https://example.com/search?q=a&b=1</loc>` 和 `<lastmod>2026-08-10</lastmod>`。失败判断:`&` 未转义、日期没有写入,或缺少 urlset 根节点。
验证 loc 读取计数
固定输入:输出框填入 `<urlset><url><loc>https://example.com/</loc></url><url><loc>https://example.com/tools</loc></url></urlset>`。步骤:点击“验证 Sitemap”。预期结果:状态提示为“发现 2 个 URL”。失败判断:实体没有还原、只计数一个 loc,或输出框为空时没有回退读取 URL 输入。
页面专属核验
使用前与操作中
- 先把每行 URL 和统一 lastmod 当作生成输入;URL 会 trim 并过滤空行,当前页面把同一个日期写入每个 `<url>`,不会为每页单独推断更新时间。
- 检查 XML 转义和 canonical 选择:`&` 等字符会进入 XML entity,提交列表应只包含应被索引的规范 URL,不要把重定向、noindex 或敏感参数页当作收录承诺。
- 区分生成/读取 Sitemap 文本与真实抓取:工具不访问 URL、不验证域名、HTTP 状态、Content-Type、canonical 或搜索引擎收录;Open Graph 分享抓取也不是 Sitemap 验证结果。
结果出来后
- 输入 `https://example.com/search?q=a&b=1` 和 `2026-08-10` 时,是否生成 urlset 命名空间、`&` 转义后的 loc 及每个 URL 的 lastmod?
- 输出框含两个 `<loc>` 时点击“验证 Sitemap”是否提示发现 2 个 URL,并还原 XML entity;这是否被正确理解为 loc 计数而非完整 XML Schema 校验?
- 提交前是否另行请求实际 sitemap.xml,确认 200、XML Content-Type、可访问 URL、robots 声明、canonical 和真实可抓取页面列表?
相关工具
- Robots.txt 生成器:生成搜索引擎爬虫规则和 Sitemap 声明
- Open Graph / Meta Tag:生成 SEO、Open Graph 和 Twitter Card 页面元标签
- HTTP 状态码:查询 HTTP 状态码含义、分类和常见排查方向
- URL 编码与解析:统一处理 URL Encode/Decode、Percent Encoding、URL 解析构建、Query String 和 Punycode
工具边界
- Sitemap 不能保证收录、排名或立即抓取。
- 大型站点需要遵守 URL 数量、文件大小、索引 Sitemap 和分片规则。
- 生成结果必须结合真实部署路径、canonical、robots 和 HTTP 响应验证。
与相似工具的区别
- Robots.txt 生成器:Sitemap 提供希望抓取的 URL 清单与更新时间;robots.txt 提供抓取限制,允许抓取也不等于会被收录。
安全与兼容性
- XML 生成与校验在浏览器本地完成;抓取线上 Sitemap 时会向目标站点发起请求并受 CORS、网络和响应大小限制。
- 只应列出公开、返回成功且 canonical 的 URL;不要暴露管理页、带密钥查询参数或个人化地址。
下一步排查
- 先用 HTTP 状态和 Headers 工具确认 sitemap.xml 的状态码、Content-Type 和缓存。
- 再与 canonical、robots.txt 和实际可索引页面列表逐项对比。
- 最后提交搜索引擎站长工具,并观察抓取错误和排除原因。
常见问题
为什么 Sitemap 提交成功但页面没有收录?
Sitemap 只提供发现线索,页面仍需可抓取、内容有价值、canonical 正确且没有 noindex 或质量问题。
参数 URL 应该放进 Sitemap 吗?
通常只提交规范的无参数 URL;追踪参数、筛选参数和重复内容可能造成抓取浪费和重复页面。