上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引入口没有指向错误版本。时间和人手有限时,最先处理的是用真实URL逐条验证robots.txt、meta robots和canonical是否互相矛盾,因为这三项冲突会直接让页面无法进入索引,且排查成本最低。
不要凭记忆检查。从站点地图、导航菜单和主要栏目页各取一批URL,整理成一份清单。清单至少覆盖:首页、栏目页、内容详情页、分页页、标签或聚合页。同时标注哪些页面希望被索引,哪些不希望被索引,例如后台登录页、搜索结果页、重复的参数页。
这一步的产出是一张对照表。没有这张表,后面看到noindex或canonical时无法判断它是配置错误还是有意为之。
抓取与索引涉及三层控制,检查顺序建议从外到内。
Disallow: /屏蔽整站,也没有误屏蔽CSS、JS或图片目录。注意robots.txt只控制抓取,不控制索引;被屏蔽的URL仍可能因外部链接出现在索引里。<meta name="robots" content="noindex">。如果模板在测试环境带了noindex,上线时忘记移除,页面能抓取但不会进索引。这是建站一条龙交付中最常见的遗漏。三项之间不能互相打架。例如一个页面robots.txt允许抓取、meta robots允许索引,但canonical指向了一个被noindex的URL,最终仍可能不索引。判断方法是:以canonical指向的目标URL为准,检查那个目标URL自身的robots和meta配置。
配置写完不等于生效,需要实际验证。可按下面步骤操作:
noindex和canonical,确认与预期一致。/robots.txt,确认语法正确、目标目录未被误封。验证时区分两类现象:页面未被抓取,可能是robots.txt屏蔽或内链缺失;页面被抓取但未索引,可能是noindex、canonical冲突或内容质量问题。同一现象有多种解释,不要看到未索引就断定是某一个原因,应逐项排除。
上线当天完成首次验证后,接下来几天到几周内关注:目标URL是否陆续出现在索引中、站点地图提交后是否被读取、服务器日志中搜索引擎爬虫的访问是否正常。若发现大量本应索引的页面长期未收录,优先回查canonical和noindex是否在模板层面被批量写错。
时间和人手有限时,把上述检查做成一份上线前清单,每次建站一条龙交付都按同一顺序过一遍,比事后补救更省成本。下一步建议:把这份清单固化为交付流程中的一个检查节点,指定一人负责执行并留下核对记录。