上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引入口指向正确版本。具体做法是:在测试环境用抓取工具模拟访问,检查 robots.txt、meta robots、canonical、sitemap 和状态码是否一致,再在上线后通过站点查询指令验证实际收录状态。以下步骤适合已有页面或项目在改版、迁移、上线前的检查,不适用于尚未确定域名的空白项目。
抓取是索引的前提。上线前最容易出问题的地方是 robots.txt 和服务器访问控制。检查时按顺序做:
https://你的域名/robots.txt,确认没有 Disallow: / 这类全站禁止规则。如果测试站曾用全站禁止,上线时必须删除或替换。curl -I 请求首页和几个典型内页,观察返回状态码。200 表示可正常访问,301/302 表示跳转,403/404/500 表示抓取受阻。判断结果:如果首页返回 200 且 robots.txt 未禁止,说明抓取通道基本通畅;如果返回 403 或 503,先解决服务器层限制,再谈索引。
抓取通畅不等于允许索引。页面级控制主要有 meta robots 和 HTTP 响应头两种形式,二者冲突时以更严格的一方为准。
<meta name="robots" content="...">。出现 noindex 的页面不会被索引,出现 nofollow 的页面链接不被追踪。X-Robots-Tag。它常用于 PDF、图片等非 HTML 资源,效果与 meta robots 类似。noindex 和 canonical 指向自身的情况,这种组合会让页面既不被索引又传递混乱信号。适用条件:这套检查针对需要被搜索流量覆盖的页面。后台、购物车、用户中心等页面通常应保持 noindex,不必强行放开。
canonical 告诉搜索引擎哪个地址是首选版本,sitemap 则主动提交希望被收录的地址。两者不一致时,索引结果容易偏离预期。
Sitemap: 行,或已通过站点管理工具提交。一个假设例子:某页面 canonical 写成 http://test.example.com/page,而正式地址是 https://www.example.com/page。这种情况下,搜索引擎可能把权重归到测试域名,正式页面迟迟不收录。把 canonical 改为正式地址后重新提交,才可能纠正。
上线前配置正确,不等于上线后立刻收录。需要区分“已提交”“已抓取”“已索引”三个状态,分别验证。
需要说明的是,收录时间和索引状态由搜索引擎决定,配置正确只是必要条件,不是收录保证。不同搜索引擎对同一份配置的处理也可能存在差异。
把以下项目逐条打勾,再决定是否正式开放抓取:
下一步:选三个代表性页面——首页、一个栏目页、一个详情页——按上述清单逐项验证,记录每项的实际返回值。发现不一致时先修正配置,再重新提交 sitemap,不要在上线当天同时改动大量配置。