先给结论:不要按“已发现”和“未发现”直接分组就下判断,因为这两组往往在发布时间、内链位置、模板类型上同时不同。更可靠的做法是,在未发现页面里再切出一个与已发现页面在关键条件上接近的子集,只改变一个变量,用这个子集作为对照组。这样得到的结果才能帮你决定下一步是改内链、改模板,还是干脆放弃这批页面。
假设你有一批旧内容,比如两年前上线的产品说明页,共 500 条。抓取日志或站长平台显示其中约 120 条被访问过,其余没有。直觉上你会把 120 条当成功组,380 条当失败组,然后去找差异。问题在于,这两组从一开始就不是同质的:被发现的页面可能恰好挂在导航或列表页上,未发现的可能只靠站内搜索才能到达。此时你观察到的所有差异,都会被“是否在内链里”这个因素污染,无法归因到标题、正文长度或发布时间上。
所以第一步不是分析,而是承认原分组不成立,需要重新构造一个更干净的比较对象。
批量页面只被部分发现,通常有两种解释。
解释一:入口不足。未被发现的页面缺少足够多、足够近的内链入口,抓取系统没有理由优先访问它们。这种情况下,页面本身质量可能没问题,只是没有被“带路”。
解释二:价值判断。这些页面在站内被视为低价值或重复内容,即使有入口,抓取预算也不会分配过去。这种情况下,补内链不会有明显效果。
区分两者的证据不在收录数量上,而在抓取行为上。如果未发现页面所在的目录、模板,其兄弟页面也普遍没有被抓取,倾向于解释一;如果同一模板下部分页面被抓取、部分没有,且被抓取的往往是内容更长或更新更近的,倾向于解释二。另一个证据是:给一小批未发现页面加上从高权重页面指向它们的链接后,观察抓取日志里是否出现对这些 URL 的访问。出现访问说明入口是主要瓶颈;完全不出现,则更可能是价值或技术层面的问题。
具体做法可以分三步。
这个动作的结果会直接影响下一步:如果加链组被抓取比例明显高于空白组,说明入口是主要限制,你可以把加链范围扩大到整个未发现集合;如果两组没有差别,说明入口不是瓶颈,应该转向检查页面内容是否与站内其他页面高度重复,或者这些页面是否本就不该继续保留。
旧内容、旧系统或旧合作关系需要退出时,批量页面的处理目标不只是“被发现”,而是“保留仍然有价值的部分”。这时对照组要额外区分:哪些页面即使被抓取也不值得保留。一个可用的判断是看页面是否还有站内引用或外部链接。如果某页面没有任何内链指向它,也没有外部链接,且内容与现有页面高度重叠,那么它属于可以退出的部分。反之,即使它当前未被发现,只要还有引用,就值得先补入口再观察。
需要提醒的是,用 robots.txt 限制抓取不等于把页面从索引中移除,站点地图提交也不保证收录。这些手段不能替代上面的对照判断,只能作为执行阶段的辅助。假设你有一批 300 条旧页面,其中 80 条仍有内链引用,220 条没有任何引用,那么优先处理的是那 80 条,而不是平均用力。这个划分本身就是对照组思路的延伸:先按“是否还有保留价值”分层,再在层内做变量对照,结论才不会被退出决策本身干扰。