上线前核对抓取与索引配置,核心是分别确认两件事:搜索引擎能否正常抓取页面,以及页面是否被允许进入索引。常见做法是先做全站抓取测试,再抽查关键页面的索引状态;如果站点规模小、页面类型单一,可以只靠人工抽查加日志判断,如果站点有大量筛选页、分页或参数链接,则更适合用抓取工具做全量扫描,再配合索引状态报告逐类核对。
robots.txt 是最容易在上线前出错的一环,尤其是从测试环境复制配置时,常残留 Disallow: /。核对时不要只看文件是否存在,要逐条读规则:
/css/、/js/、/images/ 等资源目录,资源被挡会影响页面渲染判断。Sitemap 行指向的地址可公开访问,且返回状态为 200。适用条件是站点已经确定哪些目录需要收录。如果业务上确实不希望某些页面被抓取,应写进规则并记录原因,而不是上线后再补。验收信号是:用抓取测试工具请求首页和任一核心栏目页,返回结果不是“被 robots.txt 阻止”。
robots.txt 控制抓取,noindex 控制索引,两者不能互相替代。上线前应抽查以下位置:
<head> 中的 <meta name="robots"> 是否含 noindex。X-Robots-Tag 是否含 noindex,这一项容易被忽略,却会覆盖页面内的设置。noindex,确认这是有意为之。如果站点由模板批量生成,建议按模板类型各抽一页核对,而不是只测首页。判断结果是:需要收录的页面不应出现 noindex;确实不需要收录的页面,保留 noindex 并确保它不会作用到其他模板。
同一内容如果存在多个可访问地址,例如带与不带 www、带与不带结尾斜杠、带参数与不带参数,会让索引信号分散。核对方法:
<link rel="canonical"> 是否指向自身或正确的规范页,而不是测试域名。适用条件是站点存在多域名或多路径访问。验收信号是:用抓取工具查看核心页面的 canonical 字段,与预期规范地址完全一致;如果发现指向测试域名,应在上线前统一替换。
配置核对完成后,还需要实际验证。可以按下面顺序执行:
site: 查询抽查核心页面是否开始出现,注意这只是粗略参考,不同搜索引擎结果会有差异。小站点通常几小时内就能看到抓取记录,大站点或新域名可能需要更长时间。这里不保证固定见效时间,判断依据应是状态码、抓取记录和索引报告的趋势,而不是某一次查询结果。
如果站点页面数量少、结构简单,人工抽查加抓取测试就够用,成本低、执行快。如果站点有大量参数页、筛选组合或分页,人工抽查容易漏,更适合用抓取工具做全量扫描,再按模板归类核对。选择依据是页面类型数量和 URL 组合复杂度,而不是站点规模本身。
下一步可以整理一份上线检查清单,把 robots.txt、noindex、canonical、Sitemap 和抓取测试五项固定为发布前必查项,每次上线按同一顺序执行。