结论是:不要按“发现/未发现”直接分组,而要先按页面进入检查队列的方式分组。如果一批页面里只有一部分被工具发现,真正要对比的是“通过站内链接可达”和“只能靠站点地图或外链进入”这两组,而不是把已发现页面当成处理成功、未发现页面当成处理失败。前提是你能拿到每个URL的入链来源记录;否则分组会混入抓取预算、响应速度和重复URL口径的干扰,结论不成立。
批量页面只被发现一部分,通常有三种不同原因,对应三种不同的对照组划分。
把这三组合并成“未发现”,再和“已发现”对比,得到的差异无法归因。下一步动作也会因此错位:入口层问题要补链接,抓取层问题要调检查范围,状态层问题要核对响应和过滤规则。
可操作的分组方式是:以“是否存在至少一条站内可抓取链接”为分组变量,其余条件尽量一致。
这样做的结果是:如果A组大部分被发现、B组大部分未发现,入口层就是主要嫌疑;如果两组表现接近,问题更可能在抓取范围或状态过滤,下一步应转向检查深度限制和响应记录。
假设你把所有“未发现”页面都归为入口层问题,并批量补上站内链接。但如果这些页面同时存在重复URL、参数版本或大小写差异,工具可能只是把其中一个版本当作已发现,另一个版本从未进入队列。此时补链接不会改变结果,因为问题不在入口,而在URL口径。
反例的识别信号是:未发现页面与已发现页面高度相似,仅URL形态不同。遇到这种情况,应先统一URL口径,再重新划分对照组,否则后续所有对比都建立在错误分组上。
完成分组后,先只处理对照组B中“仅站点地图可达”的页面,补一条站内链接,然后重新运行同一轮检查。观察这组页面的发现数量是否变化。如果变化,说明入口层是有效变量,可以继续扩大处理范围;如果不变,说明限制在抓取层或状态层,应改为调整检查深度、超时或过滤规则,而不是继续补链接。
需要说明的是,站点地图不保证收录,robots.txt的抓取限制也不等于可靠的索引移除。发现数量归零或部分归零,既可能是入口问题,也可能是抓取预算、响应超时、重复URL合并或过滤规则造成的,不能只凭一个信号断定原因。不同搜索引擎对这些信号的支持情况须分别核查。整个验证过程应保留每轮的请求记录和分组标记,以便下一步能复查是哪一层发生了变化,而不是只看最终数量。