上线前核对抓取与索引配置,核心是确认三件事:爬虫能顺利访问页面、页面返回正确的状态码、可索引页面没有被错误地挡住。做法不是看一遍设置就结束,而是用“抓取—解析—索引”三段逐项验证,并把结果记录在交付清单里,方便多人协作时复查。
robots.txt 是给爬虫看的访问规则,写错一个斜杠就可能挡住整站。检查时按下面顺序做:
/robots.txt,确认文件能正常返回,而不是 404 或跳转到首页。Disallow,确认没有挡住栏目页、详情页、列表页等需要收录的路径。Sitemap 指向的地址与实际提交的一致。判断依据:如果某个目录被 Disallow: / 或误写成 Disallow: / 加栏目名,爬虫就不会抓取下面的页面,页面再多也不会进入索引。测试环境的屏蔽规则尤其容易忘记删除,交付前要单独列一条检查项。
页面级控制主要有两种:HTML 里的 <meta name="robots"> 和 HTTP 响应头里的 X-Robots-Tag。冲突时以更严格的一方为准,所以两边都要看。
noindex、nofollow 这类误加的指令。如果页面既想被收录又带了 noindex,结果就是抓取正常但不进索引。这种情况在复制模板或迁移配置时最常见,属于“已经定位的原因”,不是猜测。
爬虫拿到 200 才算正常抓取。常见异常及含义:
执行方法:抽取首页、栏目页、详情页各若干条,用抓取工具或命令行请求,记录状态码与最终 URL。判断结果时看两点:重要页面是否全部为 200,跳转是否一步到位。多人协作时把这份记录附在交付文档里,复查的人不用重新猜。
sitemap 是主动告知可收录地址的清单,canonical 是指定规范地址的标签。两者指向不一致时,索引结果会变得难以判断。
一个可执行的复查动作:随机挑 5 条 sitemap 地址,逐一打开并查看源代码里的 canonical,比对是否一致。如果 sitemap 收录的是带参数的地址,而 canonical 指向无参数版本,就要统一成同一个版本再提交。
把下面几项写进上线检查表,指定一人核对、一人复核:
noindex,响应头无冲突指令。下一步:把这份清单变成可勾选的交付模板,上线后隔一段时间再抽样复查一次状态码与索引情况,确认配置没有被后续改动覆盖。