上线前核对抓取与索引配置,核心不是把页面都提交一遍,而是先确认三件事:页面能被正常访问、爬虫没有被主动挡住、页面明确表达了希望被索引的意图。时间和人手有限时,优先检查 robots 规则、页面可访问性、canonical 与 sitemap,这四项覆盖了绝大多数“上线后搜不到”的常见原因。需要强调的是,“能抓”指服务器和页面允许抓取,“让抓”指站点主动引导抓取并允许索引,两者是不同层面的问题。
很多人把 sitemap 当成收录开关,认为提交后页面就会出现在搜索结果里。实际上 sitemap 只是告诉搜索引擎“这些地址存在且值得抓取”,它不保证抓取,更不保证索引。真正决定页面能否被抓取的是 robots.txt、服务器响应、页面是否可访问;决定能否被索引的是页面自身的索引指令、内容质量和重复情况。把 sitemap 当作唯一核对项,会漏掉更靠前的阻断点。
robots.txt 是抓取阶段最先被读取的文件,写错一个 Disallow 就可能整站或整目录不被抓取。上线前应逐条确认:
Disallow: /,这会阻止全站抓取;判断方法:打开 域名/robots.txt,对照站点目录结构逐条核对。如果某条规则不确定影响范围,可以先用搜索引擎官方的 robots 测试工具验证,再决定是否保留。适用条件是站点结构清晰、规则条目不多;如果规则复杂且相互覆盖,建议先精简再上线。
抓取的前提是页面能返回正常内容。上线前抽查重点页面,确认返回的是 200 而不是 404、500 或跳转链。常见问题包括:
检查项:对首页、主要栏目页、代表性详情页各取几个样本,逐一确认状态码和最终落地地址。如果页面需要登录才能看到内容,而你又希望它被索引,就需要为爬虫提供可访问的公开版本,否则抓取和索引都无从谈起。
canonical 用来声明页面的规范地址,noindex 用来声明不希望被索引。这两者如果同时出现,或者 canonical 指向了错误地址,就会出现“页面能抓但不被索引”或“索引了错误地址”的情况。上线前应确认:
noindex;判断结果:如果 canonical 指向的地址与页面实际地址不一致,搜索引擎可能只索引 canonical 指向的地址;如果页面同时有 noindex 和 canonical,索引指令通常优先,页面不会被收录。适用条件是站点存在多地址访问或参数页面;如果站点结构单一,重点核对首页和栏目页即可。
前面三项确认无误后,再用 sitemap 和抓取测试收尾。sitemap 应只包含希望被索引的规范地址,且地址可访问、状态码正常。抓取测试可以模拟爬虫访问,观察返回内容是否完整、是否被跳转或屏蔽。
时间有限时的处理顺序建议是:先查 robots.txt,再抽查状态码,然后核对 canonical 与 noindex,最后检查 sitemap。这个顺序的原因是,越靠前的环节一旦出错,后面的提交和优化都不会生效。
下一步:按上面的顺序列一份上线检查清单,把每项检查结果标注为“通过”或“待处理”,只对“待处理”项安排修改,避免在已通过的环节反复消耗时间。