批量出现收录异常时,不要逐个 URL 查,也不要先猜原因。正确做法是先按“可复现的同一现象”分组,再从每组中抽取少量样本,用同一套检查项收集证据,最后倒推问题出在抓取、索引还是展示环节。抽样定位的目标不是一次找出全部原因,而是用最小样本量判断问题范围,并决定下一步是修模板、改配置还是单独处理个别页面。
“没被收录”本身太宽,无法直接抽样。先把它拆成可观察、可复现的现象,例如:
抽样单位要和问题对齐。模板级问题按模板抽样,目录级问题按目录抽样,参数或分页问题按 URL 模式抽样。若把不同模板、不同目录混在一起抽,样本会互相干扰,无法判断问题边界。
假设目标是判断“某批页面为何未被收录”,最终要交付的是一份可复核的定位结论,而不是一句“没收录”。倒推下来,至少需要以下资料:
robots.txt 中相关规则、页面上的 <meta name="robots">、canonical 链接、HTTP 状态码。这些资料分别对应不同责任方:URL 清单和页面配置通常由开发或内容系统提供,抓取记录由运维或日志平台提供,索引状态需要 SEO 或内容负责人核查。缺少任何一项,结论都只能停留在猜测。
没有通用的固定样本量,但可以用分层抽样控制误差。把 URL 按模板、目录或发布时间分成若干层,每层先抽 3 到 5 个样本。如果同一层内样本表现一致,可以暂时认为该层问题同质;如果表现不一致,再增加样本或重新分层。
抽样时优先选择“边界样本”:
边界样本能更快暴露差异。如果所有样本表现完全相同,问题更可能在模板或全局配置;如果只有部分样本异常,问题更可能在单页内容、链接结构或提交方式。
对每个样本 URL 执行以下检查,并记录结果。检查项要固定,否则样本之间无法对比。
curl -I 或浏览器开发者工具确认 HTTP 状态码是否为 200,是否存在跳转链。robots.txt 是否允许抓取该 URL 路径。注意:robots.txt 的抓取限制不等于可靠的索引移除,它只控制抓取,不保证页面一定不被索引。<meta name="robots"> 是否包含 noindex。把每个样本的结果填入同一张表,横向对比。若多个样本在同一项上表现一致,该项就是优先排查方向。
根据证据组合判断问题范围:
robots.txt 或 noindex 阻止:问题在全局配置,先修配置再重新提交。需要说明的是,HTTPS 不保证安全无漏洞,也不保证排名;不同搜索引擎对站点地图、robots 规则和索引状态的支持与展示方式不同,必须分别核查,不能用一个引擎的结果推断另一个。
下一步:选定一个最可能的层,抽 3 到 5 个 URL,按上述检查项填表。若同一项在多数样本中一致,先修该项并记录修改时间,再在后续检查中对比同一批样本的变化。