重复页面排查的核心,是先用可复现的方法找出内容高度相同或高度相似的URL,再判断它们是怎样产生的,最后决定保留哪一个、处理其余哪一个。对第一次接触这个问题的人来说,起点不是马上改代码,而是先列出所有可访问的URL,做一次内容比对;下一步才是按来源分类处理。下面用一个假设的例子展开。
假设某网站原来有一个产品栏目,网址是 /products/,后来改版时新增了 /product/,同时保留了旧的列表分页、标签页和打印页。此时可能出现同一批产品内容对应多个网址的情况:
/products/item-a 与 /product/item-a 内容基本相同;/products/item-a?sort=price 只是排序不同,正文主体一致;/products/item-a/print 是打印版本,正文与主页面重复;/tag/item-a 标签页聚合了同一件产品,描述文字很少。这些网址如果都能被访问、都能被链接到,就可能被搜索引擎分别抓取。排查的目标不是立刻删除,而是先确认哪些是真正重复,哪些只是参数不同但内容有差异。
从网站已有的入口出发,而不是凭记忆猜测。可以执行的操作是:
判断结果:如果两个URL的标题、正文主体和主要信息几乎一致,只是网址不同,就列为重复候选;如果正文主体明显不同,只是模板相同,则不算重复页面,应分开处理。
重复页面的产生原因不同,处理方式也不同。常见来源包括:
/old/item 与 /new/item;这里要区分“可能原因”和“已经定位的原因”。看到参数变体,只能说明参数是候选来源;要确认它是否真的被独立抓取和索引,还需要查看服务器日志或搜索表现数据。不同搜索引擎对参数和重复内容的处理方式并不相同,不能用一个平台的观察结果直接推断另一个平台。
确认来源后,再决定保留和处置方式。可参考以下判断:
适用条件:301重定向适合旧网址不再需要独立存在的场景;规范链接适合两个网址都需要保留访问、但希望搜索引擎只选一个的场景。判断结果要看处理后的抓取和索引变化,而不是当天改完就下结论。
第一次排查时,常见错误有:
比较改动前后时,应选择足够长的观察窗口,并记录改动日期、涉及网址和对应数据。一次改动前后的差异,不能单独归因于重复页面处理。
先选一个栏目,按上面的步骤收集20到50个URL,填入表格,标出内容相同、内容相似和内容不同三类。完成分类后,再对第一类网址确定保留目标,并检查站内链接是否都指向保留目标。这个动作可以直接执行,也能为后续更大范围的排查提供判断依据。