上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常抓到页面、抓到的页面允许被索引、希望收录的URL没有互相冲突。时间人手有限时,先查robots、可抓取性、canonical与sitemap这四项,再处理细节,能挡住大部分上线事故。
要查的是根目录robots.txt是否误用Disallow: /,以及是否屏蔽了CSS、JS等渲染所需资源。
/robots.txt,逐行看Disallow规则;再用搜索引擎的robots测试工具验证具体URL。适用条件:新站上线、改版迁移、更换域名时必查。判断标准是“希望被收录的URL不被Disallow”,而不是robots里规则越少越好。
要查的是目标URL返回的HTTP状态码,以及主要内容是否依赖JS才能出现。
举例(假设场景):某产品页返回200,但正文由前端接口异步加载,抓取快照中只有空容器,则该页可能被抓到却无法索引有效内容。此时应改为服务端渲染或预渲染,而不是只改meta标签。
要查的是同一内容是否存在多个可访问URL,以及canonical指向是否自洽。
www、http与https、带与不带结尾斜杠、参数版本、大小写不同路径。rel="canonical"指向的URL,再实际访问该URL,确认它返回200且内容一致。适用条件:有筛选参数、分页、打印页的站点优先处理。判断结果是“一个内容对应一个首选URL”,而不是所有URL都保留。
要查的是sitemap是否只包含希望收录的200状态URL,以及这些URL能否从首页通过链接到达。
/sitemap.xml,抽查若干条,确认可访问、非跳转、非noindex;再用站点爬虫查看从首页到目标页的点击深度。按影响面排序:先解决robots误屏蔽和5xx,再统一canonical与跳转,然后修sitemap,最后补内链和结构化数据。每改完一项,用抓取测试工具复测同一批URL,确认状态码、canonical和可索引状态同时正确,再进入下一项。
下一步:列出首页、两个栏目页、三个详情页共六个URL,逐条记录状态码、canonical、robots规则和是否在sitemap中,形成一张上线检查表,按上表顺序处理异常项。