上线前核对抓取与索引配置,核心是分两步验证:先确认搜索引擎能正常抓取页面,再确认页面没有被自身配置挡在索引之外。抓取解决“能不能拿到”,索引解决“拿到后愿不愿意收”。两者都通过,页面才有机会进入搜索结果;任一环节被阻断,后续内容质量再高也无法生效。
抓取是搜索引擎程序请求并读取页面内容,索引是把读取到的内容存入可检索的数据库。常见误区是只检查其中一个:robots.txt 允许抓取,不代表页面一定会被索引;页面没有 noindex,也不代表抓取一定顺畅。核对时要把两者当成独立检查项,分别收集证据。
<meta name="robots"> 指令、HTTP 响应头中的 X-Robots-Tag、canonical 指向、是否存在重复内容归并。抓取问题的判断依据是服务器实际返回的内容,而不是后台设置界面的显示。可以按以下顺序执行:
curl -I 或浏览器开发者工具的 Network 面板请求目标 URL,记录 HTTP 状态码。200 表示正常返回,301/302 表示跳转,403/404/5xx 表示抓取会失败或拿到错误页面。/robots.txt,确认没有用 Disallow: / 全站拦截,也没有误拦截目标目录。注意规则区分大小写,且 Allow 与 Disallow 同时命中时以更具体的规则为准。如果状态码是 200 但内容为空,可能原因是渲染依赖脚本、也可能是服务端返回了占位页,需要对比“直接请求返回的 HTML”和“浏览器渲染后的 DOM”,不能只凭一种现象就断定原因。
抓取通过后,逐项确认页面没有被主动排除索引:
<meta name="robots" content="noindex">,注意 noindex 与 nofollow 作用不同,前者阻止索引,后者只影响链接追踪。X-Robots-Tag: noindex,这种设置不会出现在 HTML 里,只看源码容易漏掉。假设一个商品页同时存在 /product?id=123 和 /product/123 两个地址,且两者都返回 200、都没有 noindex,但 canonical 都指向后者,那么前者通常不会被单独索引。这是配置生效的正常结果,不是故障。
把检查结果分成三类处理:
区分“配置阻断”和“尚未收录”很关键:前者可以立即定位并修复,后者没有固定见效时间,也不应通过反复提交来加速。
下一步:选取站点中三个不同类型的页面(首页、栏目页、内容页)各跑一遍上述清单,记录每项的实际返回值。只有三类页面都通过,才能认为抓取与索引配置整体就绪。