重复页面排查的目标不是“找到两个地址长得像的网页”,而是找出那些在搜狗看来内容高度相似、却各自积累链接与点击的页面,然后决定是合并还是保留。判断依据是页面是否满足同一搜索意图、是否有独立外链与流量价值:意图相同且没有独立价值就合并,意图不同或各自有稳定入口就保留并用规范化标明主版本。
排查从交付结果倒推:你要交出的不是一份“疑似重复清单”,而是一份“每个重复组保留哪个地址、其余地址怎么处理”的处置表。所以第一步是收集足够判断的资料。
www、http 与 https、结尾带不带斜杠、参数顺序不同、大小写不同。把每个候选地址记录下来,并标注它是否有独立外链、是否有来自搜狗的自然点击、是否是站内导航的固定入口。这三项决定了后面选合并还是规范化。
方案一:合并(把重复地址统一到一个主地址)。适用条件是这些页面服务同一搜索意图,且除主地址外的副本没有独立外链和稳定点击。做法是把副本做 301 跳转到主地址,站内链接、站点地图、分享链接全部改指主地址。判断结果:跳转生效后,副本不再作为独立入口出现在结果里,权重向主地址集中。
方案二:规范化(保留多个地址,但声明主版本)。适用条件是页面各有独立价值,比如不同颜色商品的独立页、面向不同地区的落地页,或者副本本身有外部网站链接、直接删掉会造成流量和链接损失。做法是在副本页面的 <link rel="canonical"> 指向主版本,同时保证主版本可正常访问、内容完整。判断结果:搜狗倾向把主版本作为展示对象,副本仍可访问但不与主版本争夺同一意图。
选择的分界线可以这样记:副本有没有人从站外链过来、有没有人直接搜到它。有,就优先规范化;没有,就合并。
一次改动前后做比较,不能只看某一天的展现量。搜索需求本身随季节波动,采集时间点不同、数据延迟不同,都会让数字变化。较稳妥的验收方式是:
如果发现副本仍在展示,先检查 canonical 是否写在 <head> 内、是否与 301 冲突、主版本是否被 robots 规则误挡,而不是直接判定方案无效。
下一步:挑出你站内重复组里外链和点击最多的那一组,先只处理这一组,按上面的处置表执行并记录验收结果,再决定是否把同一规则推广到其余分组。