外贸独立站上线后先补什么:robots.txt、sitemap、canonical 与收录提交流程

很多外贸独立站首版上线后,页面能打开、表单能发信,但搜索引擎看到的却不是你想让它看到的版本:带参数的 URL 被抓走,测试页进了 sitemap,产品页和博客页各写各的 canonical,最后首页收得快,产品页、分类页和解决方案页迟迟不稳。对程序员或小团队来说,这一步不复杂,难的是不要把搜索平台规则理解反。

如果你已经搭好了首页、产品分类页、产品详情页、关于页和联系页,建议先把页面结构按 外贸独立站首版页面结构清单 收口,再做本文这套 SEO 基础设施。本文不讲“包收录”或“催排名”,只讲一套适用首版上线后一周内执行、能验证、能复盘的流程。

适用阶段

  • 已经有可访问的正式域名、HTTPS 和基础页面。
  • 首页、分类页、产品页、博客页准备开始承接自然流量和询盘。
  • 团队希望同时兼顾 Google 与百度的基础抓取,不想把精力浪费在重复提交和错误 URL 上。
  • 站点后续还会继续扩展英文页、中文页、FAQ 页或解决方案页,需要先把规则打稳。

准备资料

开始前先整理 4 份清单,后面每一步都会用到:

  1. 站点唯一主域名,例如 https://example.com,先决定是否统一到 https、是否保留 www
  2. 可以被收录的页面清单,至少包括首页、核心分类页、核心产品页、关于页、联系页、隐私政策、条款页和已发布文章页。
  3. 不应进入搜索结果的页面清单,例如后台、登录、注册、站内搜索结果页、预览页、测试页、重复筛选页、表单成功页。
  4. Search Console、百度资源平台或现有提交流程的访问权限,避免上线后临时找账号。

这里最容易漏的是“表单成功页”和“带参数的筛选页”。它们对用户有用,但通常不应该成为搜索入口,更不应该和正式页面抢 canonical。很多团队首页和产品页写得很认真,最后却让搜索页、询盘成功页或 UTM 参数页先被抓到,这就是后面收录不稳的来源。

步骤 1:先列出真正要被收录的页面

这一步不是写配置,而是先决定“什么 URL 才算最终 URL”。建议按页面类型逐一确认:

  • 首页:只保留 1 个正式首页 URL。
  • 分类页:只保留面向客户的产品分类或解决方案分类页。
  • 产品页:每个产品只保留 1 个正式详情页 URL,不让打印页、预览页、参数页分走权重。
  • 内容页:博客、FAQ、解决方案页都按最终公开版本收录。
  • 信任页:关于我们、联系页、隐私政策、条款页如果面向客户公开,就应该稳定可访问。

如果你做中英双语,不要把中文页 canonical 到英文页,也不要把英文页 canonical 到中文页。两种语言如果都是独立页面,就各自保留自己的最终 URL,并分别进入 sitemap。你要做的是减少“同语言内部的重复 URL”,不是把不同语言硬合并。

步骤 2:写 robots.txt,只处理抓取边界

robots.txt 的作用是管理抓取边界,不是拿来“隐藏页面”或做 canonical。一个外贸独立站首版通常只需要拦住后台、登录、注册、搜索结果页和明显不想让蜘蛛浪费预算的路径。像产品页、分类页、CSS、JS、图片目录这类正式资源,不要为了“保守”一股脑拦掉。

User-agent: *
Allow: /
Disallow: /admin
Disallow: /login
Disallow: /register
Disallow: /search

User-agent: Baiduspider
Allow: /
Disallow: /admin
Disallow: /login
Disallow: /register
Disallow: /search

Sitemap: https://example.com/sitemap.xml
Sitemap: https://example.com/baidu_urls.txt

执行时记住两个边界:

  • 不要用 robots.txt 阻止本来要收录的页面,再指望它还能正常被理解 canonical 或 meta robots。
  • 不要把测试站、预发布目录和正式站共用同一份开放规则。测试环境要么加密码,要么整站 noindex。

步骤 3:生成 sitemap.xml,只放 canonical URL

sitemap.xml 是一份“你希望搜索平台重点理解的正式 URL 列表”,不是全站数据库导出。一个可维护的 sitemap 只放可以返回 200、允许访问、准备长期保留的最终页面。

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
    <lastmod>2026-07-07</lastmod>
  </url>
  <url>
    <loc>https://example.com/category/stainless-connectors</loc>
    <lastmod>2026-07-07</lastmod>
  </url>
  <url>
    <loc>https://example.com/product/stainless-hose-clamp</loc>
    <lastmod>2026-07-06</lastmod>
  </url>
  <url>
    <loc>https://example.com/article/how-to-choose-hose-clamps-en</loc>
    <lastmod>2026-07-07</lastmod>
  </url>
</urlset>

以下内容不要放进 sitemap:

  • 404、301、302 页面。
  • 已设为 noindex 的页面。
  • ?utm=?sort=?page= 等参数的重复 URL。
  • 后台、搜索结果页、表单成功页、预览页。
  • 还没人工审核完成的草稿产品页。

lastmod 也不要乱更新。只有主内容、结构化数据、核心链接或产品资料发生了实质变化,再更新它。否则你只是制造噪音,后面复盘时也看不出哪些页面真的改过。

步骤 4:每个正式页面都放自指 canonical

对产品页、分类页、文章页、FAQ 页和解决方案页,默认做法是“正式页面自指 canonical”。如果一个产品页可以通过多个筛选路径、参数组合或语言入口打开,canonical 要永远指向那条最终 URL。

<link rel="canonical" href="https://example.com/product/stainless-hose-clamp">
<meta name="robots" content="index,follow">

对于不应该进搜索结果、但又需要用户访问的页面,例如搜索结果页、表单成功页、活动临时页,更稳妥的做法是让页面本身返回明确的 noindex,而不是只靠 robots.txt。列表分页也不要图省事全部 canonical 到第一页;如果第 2 页、第 3 页承载的是独立可翻阅的页面,就让它们各自 self-canonical。

步骤 5:提交只是“通知”,不是催排名

配置完成后,再去做提交。顺序建议是:

  1. 先访问 robots.txtsitemap.xml,确认都返回 200。
  2. 在 Search Console 提交根目录 sitemap,并用 URL Inspection 抽查首页、1 个分类页、1 个产品页、1 篇文章页。
  3. 在百度侧提交正式 URL,优先推送新发布或刚更新的 canonical 页面。
  4. 记录本次提交的时间、URL 数量和返回状态,后面好复盘。

这里有一个很重要的风险边界:普通文章页和产品页不要滥用 Google Indexing API。对大多数外贸独立站来说,标准做法仍然是 sitemap、站内链接、必要时做 URL Inspection 抽查。你追求的是“让平台看见正确页面”,不是反复把同一批 URL 重新推几十次。对于首版站点,先把首页、核心分类页、主力产品页和 1 到 2 篇内容页收口,比一天提交几十条噪音 URL 更重要。

人工审核点

发布前至少做一次人工审核,重点看这些项目:

  • 每个正式页面是否只有 1 个能长期保留的 canonical URL。
  • robots.txt 是否误伤产品页、分类页、图片资源或脚本资源。
  • sitemap 中是否混入测试页、无内容页、重复页或未审核页面。
  • 中英文页面是否各自指向自己的 canonical,而不是相互覆盖。
  • 联系页、询盘页和 thank-you page 的收录策略是否已经说清楚。
  • 站内导航和正文链接是否能把蜘蛛带到核心页面,而不是只剩首页孤零零一页。

风险边界与常见避坑

最常见的避坑有 5 个:

  1. robots.txt 当隐私墙,结果 URL 仍可能被看到,只是抓不到内容。
  2. sitemap 放了所有数据库记录,连草稿、参数页和跳转页也一起提交。
  3. canonical、sitemap 和站内链接三套规则互相打架。
  4. 表单成功页、搜索结果页抢到了产品页和分类页的索引机会。
  5. 只提交流程、不做人工审核,最后错误页面被稳定放大。

如果后面你已经有一批旧文章或旧产品页,建议继续结合 外贸独立站旧内容怎么维护:用 Search Console 找出该修的页面和查询词 做第二轮复盘。基础设施搭对了,后面的旧内容维护才有数据可看。

可衡量结果与复盘清单

这套流程做完后,至少跟 3 组结果:

  • 48 小时内:robots.txtsitemap.xml、canonical 页面源码都能正常访问和抓取。
  • 7 天内:Search Console 的 sitemap 状态能读到文件,没有明显格式错误;关键页面能被发现。
  • 2 到 4 周内:首页、核心分类页、核心产品页和新文章页的收录情况开始稳定,错误抓取的参数页明显减少。

每周复盘时只问 4 个问题:

  1. 本周新增页面里,哪些 URL 是正式 canonical?
  2. 哪些页面应该收录却没进 sitemap 或没被内链带到?
  3. 哪些页面不该收录却暴露在抓取入口里?
  4. 哪些询盘相关页面需要调整成 noindex、更换 canonical,或从 sitemap 移除?

总结

外贸独立站首版上线后,robots.txtsitemap.xml、canonical 和提交流程不是“做完就万事大吉”的一次性动作,而是一套约束你网站边界的基础设施。先分清正式页面和非正式页面,再让抓取规则、页面规则和提交流程保持一致,后面的 SEO、内容和询盘转化优化才不会建立在错误 URL 上。