最小修复试验的核心是:每次只改一条会影响目标路径的规则,用同一批URL在修改前后各验证一次,确认差异确实来自这次改动。不要一次性重写整个文件,否则无法判断是哪条规则起了作用。下面以一个假设项目为例说明步骤。
假设某站点在robots.txt中写了以下内容(仅为示例,不是真实项目):
User-agent: *<br>Disallow: /product/<br>Allow: /product/new/
现在发现/product/guide-a没有被抓取,但/product/new/guide-b正常。问题可能出在三条规则的匹配关系上,而不是整个文件都错了。最小修复试验的目标就是只动其中一条,看目标URL的抓取状态是否变化。
/product/guide-a。/product/new/guide-b。/product/internal/。每组至少准备2到3条URL,不要只拿一条做判断。单条URL的抓取波动可能来自其他原因,比如服务器响应慢或临时屏蔽。
针对上面的假设,最小改动是把Disallow: /product/改成更精确的路径,例如只屏蔽确实不需要抓取的部分:
User-agent: *<br>Disallow: /product/internal/<br>Allow: /product/new/
这里只改了一条Disallow,Allow保留不动。这样做的目的是让组A和组B的差异只可能来自这一条规则。常见错误是同时调整User-agent、增加Sitemap、改写Allow顺序,结果无法归因。
判断结果时要注意:robots.txt只控制抓取,不控制索引。即使组A变为可抓取,也不等于它一定被收录或排名。抓取限制的解除只是让搜索引擎有机会读取页面。
/Product/和/product/可能结果不同。适用条件:当问题集中在少数路径、且你能明确列出“应抓取”和“不应抓取”两组URL时,最小修复试验最有效。如果整个站点大面积异常,或robots.txt被意外覆盖,应先恢复已知可用的版本,再按上述分组逐步排查。
下一步:选一条你怀疑被误挡的URL,复制当前robots.txt留档,然后只改一条相关规则,用同一检查工具对比修改前后的阻止状态。