排查重复页面,核心不是先改标题,而是先确认“哪些URL内容相同或高度相似,以及搜索引擎是否已分别收录”。做法是:选一个代表性页面,用site:查询、抓取工具和日志三方交叉验证,列出重复URL清单,再判断是参数、大小写、协议、尾斜杠、分页还是内容转载造成。验收信号是:重复URL能归组、每组有一个规范目标、站内链接和站点地图只指向规范目标。
不是所有相似页面都要删。以下情况优先处理:同一内容可通过多个URL打开;列表分页与筛选参数生成大量近似页;http与https、带www与不带www都能访问同一页;商品或文章被多个栏目路径重复发布。
如果页面内容确实不同,只是主题相近,不属于重复页面问题,不要强行合并。判断依据是正文主体、标题、主要信息是否基本一致,而不是URL看起来像不像。
site:你的域名 页面标题中的独特短语,观察返回结果里是否出现多个URL指向同一内容。注意这只是线索,不同搜索引擎结果会有差异。三方结果不一致时,以“实际可访问且被抓取”的URL为准。例如工具抓到参数页,但日志显示搜索引擎从未访问,可先处理站内链接,不必紧急删除。
rel="canonical"指向规范页,并避免站内大量链接带参数。http与https、www与裸域同时可访问时,选一个作为规范主机,其余做301跳转。/page与/page/都返回200时,确定一种形式并全站统一,另一种301跳转。假设某站有/product?id=123和/product/123两个URL,内容相同,站内链接混用。此时应把带参数的URL 301到静态路径,并修改站内链接和站点地图,只保留静态路径。这是假设示例,不是真实项目结果。
处理完成后逐项核对:
比较改动前后数据时,要考虑季节、搜索需求和采集差异,不能只看某一天排名变化就断定生效。若重复URL仍被大量内链指向,规范标签的效果会被削弱,应先改链接。
先选一个重复最明显的页面组,按“搜索查询—抓取导出—日志核对”走一遍,记录重复URL、当前状态码、规范目标和内链来源。确认处理方式后,再批量套用到其他页面组,避免一次性全站改动导致无法定位问题。