结论先行:中断后不要直接重跑全站,也不要凭“已扫描页数”认定覆盖完整。先看扫描日志里最后一条成功记录的标识,再与你的页面清单做差集,才能判断哪些范围已经覆盖、哪些必须补扫。若日志只记录进度百分比而没有保留页面级标识,这个判断方法就会失效,此时应改为按站点地图分段重扫。
关键词位置查询的全站扫描通常有两种记录方式,它们决定了你能否还原已覆盖范围。
两种口径对应两种恢复动作。页面级日志可以增量补扫;进度级日志只能按批次重新划分范围,从头覆盖,否则会漏掉中间被跳过的页面。
假设你手上有一份本次扫描应有的页面清单(来自站点地图、栏目导出或上次扫描结果),可以这样操作:
如果缺口集中在某一栏目,说明中断可能发生在该栏目的扫描阶段,补扫该栏目即可。如果缺口随机分布,说明中断时间点不确定,建议对全部未覆盖页面重扫,而不是只补最后一批。
差集方法有一个前提:页面清单本身是完整的,且日志里的页面标识与清单能一一对应。反例是动态参数页——清单里记的是规范化链接,日志里记的是带参数的原始链接,两者对不上,差集会显示大量“未覆盖”,实际却已经扫过。此时应先统一标识规则(去参数、统一大小写、统一结尾斜杠),再做差集,否则会误判缺口规模。
另一个反例是扫描中途更换了页面清单。如果中断前后使用的清单版本不同,差集结果会把新增页面全部算作未覆盖,把已删除页面算作多余访问,覆盖判断失去意义。这种情况下应以中断时刻的清单版本为准,重新生成一次对比。
确定缺口范围后,先只补扫其中一个栏目,观察补扫日志是否连续、是否出现大量超时或跳转。如果补扫顺利,说明中断原因是偶发的网络或资源限制,可以继续按栏目推进;如果补扫同样在相近位置中断,说明问题与页面结构或扫描配置有关,继续分批补扫只会重复失败,应先调整抓取间隔或排除规则,再重新评估覆盖范围。
这个动作的价值在于:它把“已覆盖范围”的判断从一次性结论变成可验证的过程。补扫结果本身会告诉你,之前的缺口是中断造成的,还是扫描器本来就无法处理这类页面。
把已确认覆盖的页面标识单独存档,标注扫描时间与清单版本;把未覆盖页面按栏目拆成补扫批次;补扫完成后,用同一套差集方法再核对一次。只有当 B 减 A 为空、且 A 减 B 中的页面都已确认处理方式时,才能认为本次全站覆盖完整。在此之前,任何基于这次扫描的位置结论都应标注覆盖范围,避免把未扫描页面的缺失当成排名变化。