外贸独立站上线后先补什么:robots.txt、sitemap、canonical 与收录提交流程
很多外贸独立站首版上线后,页面能打开、表单能发信,但搜索引擎看到的却不是你想让它看到的版本:带参数的 URL 被抓走,测试页进了 sitemap,产品页和博客页各写各的 canonical,最后首页收得快,产品页、分类页和解决方案页迟迟不稳。对程序员或小团队来说,这一步不复杂,难的是不要把搜索平台规则理解反。
如果你已经搭好了首页、产品分类页、产品详情页、关于页和联系页,建议先把页面结构按 外贸独立站首版页面结构清单 收口,再做本文这套 SEO 基础设施。本文不讲“包收录”或“催排名”,只讲一套适用首版上线后一周内执行、能验证、能复盘的流程。
适用阶段
- 已经有可访问的正式域名、HTTPS 和基础页面。
- 首页、分类页、产品页、博客页准备开始承接自然流量和询盘。
- 团队希望同时兼顾 Google 与百度的基础抓取,不想把精力浪费在重复提交和错误 URL 上。
- 站点后续还会继续扩展英文页、中文页、FAQ 页或解决方案页,需要先把规则打稳。
准备资料
开始前先整理 4 份清单,后面每一步都会用到:
- 站点唯一主域名,例如
https://example.com,先决定是否统一到https、是否保留www。 - 可以被收录的页面清单,至少包括首页、核心分类页、核心产品页、关于页、联系页、隐私政策、条款页和已发布文章页。
- 不应进入搜索结果的页面清单,例如后台、登录、注册、站内搜索结果页、预览页、测试页、重复筛选页、表单成功页。
- Search Console、百度资源平台或现有提交流程的访问权限,避免上线后临时找账号。
这里最容易漏的是“表单成功页”和“带参数的筛选页”。它们对用户有用,但通常不应该成为搜索入口,更不应该和正式页面抢 canonical。很多团队首页和产品页写得很认真,最后却让搜索页、询盘成功页或 UTM 参数页先被抓到,这就是后面收录不稳的来源。
步骤 1:先列出真正要被收录的页面
这一步不是写配置,而是先决定“什么 URL 才算最终 URL”。建议按页面类型逐一确认:
- 首页:只保留 1 个正式首页 URL。
- 分类页:只保留面向客户的产品分类或解决方案分类页。
- 产品页:每个产品只保留 1 个正式详情页 URL,不让打印页、预览页、参数页分走权重。
- 内容页:博客、FAQ、解决方案页都按最终公开版本收录。
- 信任页:关于我们、联系页、隐私政策、条款页如果面向客户公开,就应该稳定可访问。
如果你做中英双语,不要把中文页 canonical 到英文页,也不要把英文页 canonical 到中文页。两种语言如果都是独立页面,就各自保留自己的最终 URL,并分别进入 sitemap。你要做的是减少“同语言内部的重复 URL”,不是把不同语言硬合并。
步骤 2:写 robots.txt,只处理抓取边界
robots.txt 的作用是管理抓取边界,不是拿来“隐藏页面”或做 canonical。一个外贸独立站首版通常只需要拦住后台、登录、注册、搜索结果页和明显不想让蜘蛛浪费预算的路径。像产品页、分类页、CSS、JS、图片目录这类正式资源,不要为了“保守”一股脑拦掉。
User-agent: *
Allow: /
Disallow: /admin
Disallow: /login
Disallow: /register
Disallow: /search
User-agent: Baiduspider
Allow: /
Disallow: /admin
Disallow: /login
Disallow: /register
Disallow: /search
Sitemap: https://example.com/sitemap.xml
Sitemap: https://example.com/baidu_urls.txt
执行时记住两个边界:
- 不要用
robots.txt阻止本来要收录的页面,再指望它还能正常被理解 canonical 或 meta robots。 - 不要把测试站、预发布目录和正式站共用同一份开放规则。测试环境要么加密码,要么整站 noindex。
步骤 3:生成 sitemap.xml,只放 canonical URL
sitemap.xml 是一份“你希望搜索平台重点理解的正式 URL 列表”,不是全站数据库导出。一个可维护的 sitemap 只放可以返回 200、允许访问、准备长期保留的最终页面。
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/</loc>
<lastmod>2026-07-07</lastmod>
</url>
<url>
<loc>https://example.com/category/stainless-connectors</loc>
<lastmod>2026-07-07</lastmod>
</url>
<url>
<loc>https://example.com/product/stainless-hose-clamp</loc>
<lastmod>2026-07-06</lastmod>
</url>
<url>
<loc>https://example.com/article/how-to-choose-hose-clamps-en</loc>
<lastmod>2026-07-07</lastmod>
</url>
</urlset>
以下内容不要放进 sitemap:
- 404、301、302 页面。
- 已设为
noindex的页面。 - 带
?utm=、?sort=、?page=等参数的重复 URL。 - 后台、搜索结果页、表单成功页、预览页。
- 还没人工审核完成的草稿产品页。
lastmod 也不要乱更新。只有主内容、结构化数据、核心链接或产品资料发生了实质变化,再更新它。否则你只是制造噪音,后面复盘时也看不出哪些页面真的改过。
步骤 4:每个正式页面都放自指 canonical
对产品页、分类页、文章页、FAQ 页和解决方案页,默认做法是“正式页面自指 canonical”。如果一个产品页可以通过多个筛选路径、参数组合或语言入口打开,canonical 要永远指向那条最终 URL。
<link rel="canonical" href="https://example.com/product/stainless-hose-clamp">
<meta name="robots" content="index,follow">
对于不应该进搜索结果、但又需要用户访问的页面,例如搜索结果页、表单成功页、活动临时页,更稳妥的做法是让页面本身返回明确的 noindex,而不是只靠 robots.txt。列表分页也不要图省事全部 canonical 到第一页;如果第 2 页、第 3 页承载的是独立可翻阅的页面,就让它们各自 self-canonical。
步骤 5:提交只是“通知”,不是催排名
配置完成后,再去做提交。顺序建议是:
- 先访问
robots.txt和sitemap.xml,确认都返回 200。 - 在 Search Console 提交根目录 sitemap,并用 URL Inspection 抽查首页、1 个分类页、1 个产品页、1 篇文章页。
- 在百度侧提交正式 URL,优先推送新发布或刚更新的 canonical 页面。
- 记录本次提交的时间、URL 数量和返回状态,后面好复盘。
这里有一个很重要的风险边界:普通文章页和产品页不要滥用 Google Indexing API。对大多数外贸独立站来说,标准做法仍然是 sitemap、站内链接、必要时做 URL Inspection 抽查。你追求的是“让平台看见正确页面”,不是反复把同一批 URL 重新推几十次。对于首版站点,先把首页、核心分类页、主力产品页和 1 到 2 篇内容页收口,比一天提交几十条噪音 URL 更重要。
人工审核点
发布前至少做一次人工审核,重点看这些项目:
- 每个正式页面是否只有 1 个能长期保留的 canonical URL。
robots.txt是否误伤产品页、分类页、图片资源或脚本资源。- sitemap 中是否混入测试页、无内容页、重复页或未审核页面。
- 中英文页面是否各自指向自己的 canonical,而不是相互覆盖。
- 联系页、询盘页和 thank-you page 的收录策略是否已经说清楚。
- 站内导航和正文链接是否能把蜘蛛带到核心页面,而不是只剩首页孤零零一页。
风险边界与常见避坑
最常见的避坑有 5 个:
- 把
robots.txt当隐私墙,结果 URL 仍可能被看到,只是抓不到内容。 - sitemap 放了所有数据库记录,连草稿、参数页和跳转页也一起提交。
- canonical、sitemap 和站内链接三套规则互相打架。
- 表单成功页、搜索结果页抢到了产品页和分类页的索引机会。
- 只提交流程、不做人工审核,最后错误页面被稳定放大。
如果后面你已经有一批旧文章或旧产品页,建议继续结合 外贸独立站旧内容怎么维护:用 Search Console 找出该修的页面和查询词 做第二轮复盘。基础设施搭对了,后面的旧内容维护才有数据可看。
可衡量结果与复盘清单
这套流程做完后,至少跟 3 组结果:
- 48 小时内:
robots.txt、sitemap.xml、canonical 页面源码都能正常访问和抓取。 - 7 天内:Search Console 的 sitemap 状态能读到文件,没有明显格式错误;关键页面能被发现。
- 2 到 4 周内:首页、核心分类页、核心产品页和新文章页的收录情况开始稳定,错误抓取的参数页明显减少。
每周复盘时只问 4 个问题:
- 本周新增页面里,哪些 URL 是正式 canonical?
- 哪些页面应该收录却没进 sitemap 或没被内链带到?
- 哪些页面不该收录却暴露在抓取入口里?
- 哪些询盘相关页面需要调整成
noindex、更换 canonical,或从 sitemap 移除?
总结
外贸独立站首版上线后,robots.txt、sitemap.xml、canonical 和提交流程不是“做完就万事大吉”的一次性动作,而是一套约束你网站边界的基础设施。先分清正式页面和非正式页面,再让抓取规则、页面规则和提交流程保持一致,后面的 SEO、内容和询盘转化优化才不会建立在错误 URL 上。