排查重复页面,核心是找出内容高度相同或高度相似、却拥有多个可访问地址的页面,再判断每个重复地址是否有独立保留价值。可合并的做301指向保留页,需保留的用canonical或参数规范声明主版本。下面给出一份可执行清单,每项都说明查什么、怎么查、结果说明什么。
要查的是同一篇内容是否存在多个URL变体。在搜索引擎中用site:你的域名配合核心词检索,再用inurl:限定参数、目录或后缀。例如某篇文章正常地址是/a/123.html,若还出现/a/123.html?from=wx、/a/123.html/、/a/123.html?utm_source=x,就属于疑似重复。
把疑似重复的两个地址分别打开,对比标题、正文首段、主体段落、图片和结构化数据。判断依据不是“看起来像”,而是正文主体是否表达同一件事、是否只有少量模板文字不同。
重复页面多数不是编辑重复发布,而是技术配置产生。重点查以下三类:
http与https、带www与不带www同时可访问。查法:分别输入四种组合访问同一页面。结果说明:能同时打开且内容相同,说明存在主机名重复,需统一跳转到一个主版本。确认重复后,常见两种方案:301合并与canonical声明保留。选择条件如下。
<head>中声明指向主版本。判断结果:用户仍能打开原地址,搜索引擎被建议以主版本为准。假设某商品页同时存在/p/100和/p/100?color=red,且红色版本没有独立搜索量,就适合301合并;若红色版本有独立关键词和外部链接,则适合保留并用canonical指向自身或主版本。这是假设示例,实际以自身数据为准。
处理完成后,不要只看某一天的收录数或排名变化。比较时要考虑季节波动、搜索需求变化、数据采集口径差异。可执行做法是:记录改动日期、受影响地址清单、处理方式,然后在后续周期内观察这些地址是否仍作为独立重复结果出现,以及主版本是否稳定承接流量。若重复地址减少但主版本流量未同步变化,需回查跳转是否生效、canonical是否写对。
下一步:从站内导出全部可访问地址,按正文指纹分组,先处理参数与主机名这两类最容易批量修正的重复,再逐个人工判断内容相似页是否需要保留。