上线前核对抓取与索引配置,优先顺序是:先确认搜索引擎能抓到页面,再确认抓到的是正确版本,最后确认允许被索引。时间和人手有限时,不要逐页检查,而是用样本页加配置文件做交叉验证。一个常见误解是“页面能打开就等于能被收录”,实际上服务器返回状态、robots 规则、canonical 和 sitemap 任一环节出问题,都可能让页面抓得到却进不了索引。
抓取指搜索引擎爬虫请求并下载页面,索引指搜索引擎把页面内容存入可供检索的数据库。抓取成功不代表会被索引,索引也不代表会获得排名。核对时要把这两件事分开看,否则容易把“未收录”误判成“抓取失败”。
如果站点刚上线,先保证核心页面可抓取,再处理索引信号。人手有限时,优先核对首页、栏目页和转化页,不必一次覆盖全部文章。
直接访问页面看到内容,不等于爬虫看到同样内容。可以执行以下步骤:
适用条件是站点结构不复杂、页面数量有限。判断结果是:状态码正常且关键内容在初始 HTML 或可稳定渲染的脚本中,抓取环节基本可用;若状态码异常或内容缺失,应先修技术问题,再谈索引。
常见错误是 robots.txt 放行了,页面却带 noindex;或者页面想被索引,robots.txt 却屏蔽了整站。核对方法如下:
Disallow: / 这类全站屏蔽规则误伤正式环境。<meta name="robots"> 是否含 noindex 或 none。测试环境复制到正式环境时,这类标签最容易遗留。如果 robots.txt 屏蔽了某个目录,而该目录页面又带 noindex,两者都指向“不索引”,结果一致;但如果 robots.txt 放行、页面 noindex,则抓取可能发生而索引被拒绝。判断时以页面实际输出为准,不要只看配置文件。
canonical 用来告诉搜索引擎哪个 URL 是首选版本,sitemap 用来提交希望被抓取的地址。两者不一致时,索引信号会分散。核对项包括:
假设一个详情页可以通过 /p/123 和 /p/123?from=list 两个地址访问,若两者都返回 200 且 canonical 各指自身,就可能被当成重复内容。正确处理是选定一个主地址,另一个做 301 跳转或 canonical 指向主地址。适用条件是参数仅用于统计、不改变页面主体内容;若参数确实对应不同内容,则不应合并。
时间和人手有限时,按下面顺序执行,每项都能给出明确判断:
完成以上核对后,下一步是记录每个核心页面的最终 URL 和 canonical,作为后续排查收录问题的基准。若发现某页抓取正常但长期未索引,再回到内容质量和重复度层面分析,而不是反复修改 robots 规则。