核对抓取限制,不是看一遍robots.txt就算完成,而是从“哪些页面必须被抓、哪些必须禁止、谁改、怎么验”四个交付点倒推。多人协作时,先确定验收标准,再分配资料和任务,最后用抓取日志或抓取测试逐项对照,才能减少返工。
抓取限制涉及多个位置,任何一处改动都可能影响整站。建议把交付物固定为四份材料:一份URL范围清单、一份当前限制规则截图或文本、一份逐条核对记录、一份改动后的验证结果。缺少任何一份,后续接手的人都只能重新排查。
适用条件是站点有多个栏目或多人共同维护。如果只有几个静态页面,材料可以精简,但“期望结果”和“实际结果”两列不能省。
抓取限制核对最容易返工的环节,是改规则的人不知道业务上哪些页面重要,写内容的人不知道技术限制已经变化。可以按下面的分工推进:
责任划分的判断标准很简单:谁最清楚页面的业务价值,谁负责确认“该不该抓”;谁掌握发布权限,谁负责改;谁提出需求,谁负责验收。三者可以是同一人,但角色不能混着默认。
核对时不要只搜索一个禁止符号,要按限制生效的位置逐层检查。以下检查项可以直接作为核对表使用:
robots.txt:检查是否误屏蔽整站、是否屏蔽了CSS或JS等渲染资源、规则是否指向正确的目录层级。noindex或nofollow,列表页和详情页是否被同一模板误伤。假设一个站点把/search目录整体禁止抓取,但站内部分重要内容也放在该目录下,就会出现内容无法被抓取的结果。这类问题不能只凭规则文本判断,要结合URL清单确认目录用途。
改动完成后,至少做两步验证。第一步,用抓取测试工具请求目标URL,查看返回状态和抓取结果;第二步,在服务器日志中观察目标URL是否仍有抓取记录。两步结果一致,才能认为改动生效。
比较改动前后时要注意:搜索需求会随季节和事件变化,抓取频次本身也会波动,不能把某一天抓取量下降直接归因于限制改动。更可靠的做法是对照同一批URL、同一时间段,比较改动前后的抓取状态,而不是只看总量。
如果验证发现需要抓取的页面仍被限制,先回退到改动前状态,再逐项排查是robots.txt、meta robots还是响应头在起作用。不要同时改多处,否则无法判断是哪一处造成的结果。
下一步,把上面的四份交付物合成一份核对表,指定一名负责人,在改动前完成一次全量对照,再进入修改和验收。