批量页面不被收录时,抽样定位的目标不是找出“唯一原因”,而是用尽量少的样本,把问题分成几类:抓取被挡、抓取正常但未索引、内容质量不足、重复或参数泛滥、内链权重到不了。做法是先按页面类型和时间分层,再从每层随机抽 5–10 条,用同一套检查项逐条比对,最后看哪一层的异常比例最高,优先修那一层。
直接翻收录情况,容易只看到少数重点页。抽样前先按可解释的维度分组:
每层抽 5–10 条即可。样本太少会误判,太多则拖慢排查。抽到的页面要记录 URL、模板、发布时间、内链数量、返回状态码,后续对比才有一致依据。
把检查项固定下来,逐条打勾,才能比较不同层之间的差异:
site: 查询或搜索控制台类工具的收录报告,确认该 URL 是否已被索引。注意不同搜索引擎结果要分别核查,不能用一个引擎的结论推另一个。robots.txt 是否对该路径或该 user-agent 有 Disallow。要记住:robots.txt 只能限制抓取,不等于可靠的索引移除;被挡抓取的页面仍可能因外部链接被索引。<meta name="robots"> 是否为 noindex,以及是否有 X-Robots-Tag 响应头做同样限制。把这些结果填进一张表,按层统计异常比例。例如详情页 8 个样本中有 6 个 canonical 指向列表页,而列表页样本基本正常,那问题就集中在详情页模板,而不是全站。
抽样定位的关键是对比:同一模板里被收录和未被收录的页面有什么不同?同一批新页里,有内链的和没内链的差在哪?
假设某项目抽了 20 条未收录页面,其中 14 条来自同一模板,且这 14 条中有 12 条 canonical 指向了别的 URL。这只能说明该模板存在高风险,不能直接断言 canonical 是唯一原因——还需要把 canonical 修正后再观察一轮。反过来,如果各层异常比例都低,就要考虑抓取频率、站点整体权重和内容竞争力,而不是继续在单页上找技术错误。
判断结果时区分“可能原因”和“已经定位的原因”:前者是现象有多个解释,后者是修改某一项后样本收录状态发生变化。抽样只能缩小范围,不能替代修改后的验证。
从交付结果倒推,一次抽样定位至少要产出四样东西:
验收不保证固定见效时间,也不保证一定收录。能确认的是:如果同一层样本在修改后异常项减少,说明定位方向有效;如果异常项没变,就要回到抽样表,检查是否漏掉了抓取层面的限制,或者问题根本不在这一层。
下一步:从你手上未收录页面最多的那个模板开始,抽 10 条,按上面的检查项逐条记录,先找出异常比例最高的一项,再决定改哪里。