核对抓取限制,核心不是先问“哪里被挡了”,而是先明确你希望搜索引擎最终抓到、收录并展示哪些页面,再倒推需要哪些资料、谁来做、做到什么程度算验收。抓取限制可能来自服务器、页面代码、站点规则文件或平台侧设置,同一现象往往有多个解释,必须逐项验证,不能凭一次报错下结论。
把目标写具体,例如:某栏目下20个详情页可被抓取、可索引,且不误抓筛选参数页。由此倒推四类资料:
robots.txt、页面<meta name="robots">、响应头中的X-Robots-Tag。建议按“服务器→站点规则→页面指令→渲染与内链”的顺序排查,每一步都记录现象和判断依据。
robots.txt,确认目标路径是否被Disallow。注意规则按最长匹配和具体路径生效,不要只看一行就下结论。<meta name="robots">和响应头X-Robots-Tag。出现noindex会阻止索引,nofollow影响链接跟踪,二者与抓取限制不是同一件事。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能把波动直接归因于抓取限制。可执行的最小对比是:
例如(假设场景):某详情页在抓取工具中返回200,但索引状态长期不更新。对照同栏目另一页可正常索引,进一步发现目标页响应头含X-Robots-Tag: noindex。此时可定位为页面指令问题,而非服务器封禁。若两页都返回503,则更可能是服务器临时过载,需先恢复服务再复测。
核对完成后,把结论写成可验收项:哪条规则、哪个文件、哪次响应、由谁修改、修改后用什么工具复测。验收时至少确认三点:目标URL返回正常状态、无阻止抓取的指令、有可发现的内链入口。若涉及平台侧抓取设置,以该平台当前实际界面和文档为准,不套用旧入口位置。
下一步:从你希望被抓取的那批URL中抽3至5个样本,按上述顺序做一次请求与规则核对,把异常项和对照结果记录在同一张表里,再决定改服务器、改规则还是改页面模板。