当筛选、排序、分页、追踪等参数可以自由组合,地址空间会接近无限;此时“有效地址集合”不应按实际出现过的 URL 定义,而应按可返回唯一内容的参数组合定义。缺少完整日志或权限时,仍可先从规范规则和可抓取入口入手,但只能得出规则层面的结论,不能据此断言哪些地址已被收录或会被移除。
有效地址集合的边界不是“参数越少越好”,而是每个组合是否对应独立、稳定、对用户有意义的页面。可操作的定义方式如下:
这个定义成立的前提是:参数语义稳定,且归一后的页面确实包含用户原本想找的内容。若排序参数会改变默认展示的商品集合,把它简单归一到默认排序就可能让用户看到不同结果,此时应保留该参数或改为可抓取的独立地址。
假设某站点把 ?sort=price、?page=2、?ref=ad 全部永久重定向到无参数版本。表面看地址集合被压缩了,但如果分页参数承载的是列表的第二页内容,重定向到第一页会让用户和抓取程序都拿不到原本存在的条目。这时“有效地址集合”被定义得过窄,永久重定向反而隐藏了真实内容。
反过来,如果 ?ref=ad 只影响统计、不影响页面内容,把它永久重定向到无参数版本通常是合理的。判断依据不是参数名字,而是同一参数取值变化后,页面主体内容是否发生实质变化。
没有完整访问日志、没有搜索平台权限时,仍可做三件事,并明确各自能推出什么:
curl -I 或浏览器开发者工具检查代表性组合返回的状态码和最终地址,确认永久重定向是否形成链或循环。结果是配置行为样本,不能代表所有组合。这些动作能帮助确定“哪些参数模式应进入有效集合”,但不能推出“未被抽到的组合一定无效”,也不能推出“已设置的永久重定向一定被正确处理”。抓取量或某类请求量下降,也可能来自抓取预算调整、入口链接变化或规则误伤,不能单独作为处理正确的证据。
规则上线后,优先验证三类地址:带追踪参数的、带排序参数的、带分页参数的。对每一类,记录重定向前后的状态码、最终地址和页面主体内容是否一致。若发现分页或筛选结果被错误归一,应把该参数移出归一范围,而不是继续扩大重定向覆盖。
同时注意:robots.txt 的抓取限制不等于可靠的索引移除,站点地图也不保证收录。永久重定向解决的是地址归一和信号传递问题,不能替代对内容可访问性的验证。下一步动作应是把例外清单转化为可回归的检查用例,并在每次参数规则变更后重跑,而不是一次性设置后不再复核。