上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能拿到页面、拿到的页面允许被索引、页面返回的状态与规范化地址符合预期。做法不是看后台开关,而是用真实请求和抓取工具逐项验证,并保留复查记录。
抓取是索引的前提。若服务器拒绝、返回错误或内容依赖脚本渲染,后续索引配置再正确也没有意义。
robots.txt 是否屏蔽了目标路径,注意 Disallow 与 Allow 的匹配顺序。<meta name="robots" content="noindex">,这类页面即使被抓取也不会进入索引。判断方法:把请求结果与预期页面逐项对照。状态码异常、robots 屏蔽、noindex 三者任一命中,都说明当前配置阻止了正常收录,应先修复再谈其他优化。
页面能被抓取,不等于会被索引。需要确认索引指令和规范链接是否指向同一个期望地址。
robots 元标签和 HTTP 响应头中的 X-Robots-Tag,两者都可能携带 noindex。<link rel="canonical">,确认它指向的是首选地址,而不是测试域名、带参数的临时地址或已废弃路径。www 与不带 www、http 与 https、带尾斜杠与不带尾斜杠。这里的关键对比是“期望索引的地址”和“页面实际声明的规范地址”是否一致。若不一致,搜索引擎可能选择另一个地址作为规范版本,导致目标页面迟迟不出现。
人工查看源码容易遗漏,建议用搜索引擎官方提供的抓取测试或网址检查工具模拟一次访问。操作时注意:
假设某产品页在工具中返回 200,robots 允许抓取,但源码里写着 noindex,那么可以定位为索引指令阻止收录,而不是服务器问题。这个判断只在证据同时满足时才成立。
配置核对不是一次性的。上线后应在一段时间内复查关键页面的状态,确认没有因部署、缓存或安全策略变化而回退。
下一步:选一个核心页面,按“请求状态码—robots—noindex—canonical”的顺序走一遍,把结果记成一行清单;任何一项不符合预期,先修这一项,再重新核对。