当同一批新页面只有一部分被搜索引擎发现时,划分对照组的目的不是证明“哪些页面更好”,而是把“外链来源”和“页面自身条件”分开,避免把两种原因混在一起。建议先按“外链是否落在该具体页面上”做第一层分组,再按“页面是否存在独立入口”做第二层分组,形成四类:有直链且有入口、有直链但无入口、无直链但有入口、无直链且无入口。这样后续观察发现率变化时,才能判断到底是外链在起作用,还是站点内部结构在起作用。
这两个变量经常同时变化,所以不能只按“有没有外链”分组。如果所有带外链的页面同时也在导航或列表里出现,那么发现率差异既可能来自外链,也可能来自内部入口。此时应该把有外链的页面再拆成“外链指向该页面本身”和“外链只指向栏目或首页”两类。只有前者才属于针对该页面的外部信号,后者更接近站点整体权重传递,不能混为一谈。
一个可操作的判断是:打开外链所在页面,确认链接的落地地址是否精确到目标 URL。如果落地地址是栏目页、标签页或首页,那么该页面在外链维度上应归入“无直链”组,而不是“有直链”组。这个动作会直接改变分组结果,也会影响下一步该补外链还是补内部入口。
只分“有外链”和“无外链”两组,在批量页面场景里往往不够,因为页面还可能因为站点地图、内部链接、历史抓取记录等原因被单独发现。更稳妥的做法是四格分组:
分组后不要急着改所有页面。先记录每组在相同时间窗口内的发现情况,再决定下一步动作。如果“有直链但无独立入口”组明显高于“无直链但有独立入口”组,优先补外链直链更合理;如果反过来,则应先修内部入口,而不是继续加外链。
划分完四组后,下一步是固定一个观察窗口,例如以站点地图最后修改时间或页面发布时间为起点,统一观察若干天。窗口内不要同时给所有组加外链、改模板、提交索引,否则又会变成多变量混合。更合理的顺序是:先只给“无直链但有独立入口”组补一条精确指向该页面的外链,观察该组发现率是否向“有直链且有独立入口”组靠拢;如果靠拢,说明外链直链是当前遗漏条件;如果不靠拢,再检查内部入口是否真的可抓取。
这里的实际动作是:选一组页面,只增加外链直链,不改标题、不改正文、不改内部链接,然后对比该组与未处理组的发现差异。这个动作的结果会决定下一步是扩大外链范围,还是回到站内结构排查。
有些页面虽然属于“无直链且无独立入口”,但仍然可能因为站点地图、历史抓取或外部转载被发现。站点地图不保证收录,robots.txt 的抓取限制也不等于可靠的索引移除,所以不能把“站点地图里存在”当作已发现证据。反过来,某个页面被发现也不一定是因为外链,可能只是它恰好被内部搜索页、相关推荐或历史快照带出。遇到这类情况,应把该页面单独标记为“存在其他入口”,不要强行塞进四格中的某一格。
如果外链来自同一域名下的多个页面,也不应当作多个独立外链来源。同一域名重复链接对分组的干扰很大,最好按“独立域名数”而不是“链接数”来划分外链强度。这样得到的对照组更接近真实差异,后续调整外链时也更容易判断是数量问题还是来源集中问题。
如果四组之间的发现率差异很小,或者同一组内部差异很大,说明当前批量页面的遗漏原因可能不在外链或入口,而在页面级因素,例如内容重复、参数过多、返回状态异常或渲染后内容为空。此时继续扩大对照组只会增加噪声,应该转为逐页排查:抽取每组中未发现和已发现的页面各若干条,比较它们的返回状态、可抓取内容、内部链接位置和外链落地地址。只有找到组内共同差异,才值得重新划分对照组。
划分对照组的最终目的,是让下一次调整只改变一个条件,并能从结果反推遗漏原因。如果分组后仍然同时改多个变量,那么即使发现率变化,也无法判断是哪一项动作起了作用,下一步就只能继续猜测。