重复页面排查的核心是收集证据,而不是凭感觉删页面。先用站点查询和抓取工具找出内容高度相似或完全相同的URL,再判断是技术参数、分页、筛选、打印版还是内容搬运造成的,最后按“保留哪个、合并哪个、屏蔽哪个”分别处理。下面用一个假设例子说明步骤。
假设一个销售家具的网站,列表页支持按颜色、材质、价格筛选。运营人员发现,同一批沙发商品可以通过多个URL访问:/sofa?color=gray、/sofa?color=grey、/sofa?sort=price。这些页面标题几乎一样,正文商品也大量重合。此时不能直接判定某一项是唯一原因,因为参数、排序、分页都可能各自产生重复,需要逐项验证。
先做站内搜索,在搜索引擎输入site:你的域名加上一段独特正文,看返回多少条结果。再用抓取工具爬取全站,导出所有URL、标题、正文摘要和状态码。最后用表格函数或文本比对工具,把标题和正文前200字做相似度对比。常见错误是只看URL不同就断定重复,其实标题和正文差异明显的页面未必构成重复;反过来,URL不同但正文几乎一致的页面才是重点。
如果重复来自筛选参数,且筛选结果对用户有价值,可以保留可索引的主筛选组合,把无意义的排序参数用robots.txt或页面级指令处理。如果重复来自打印版、移动版或旧域名,应优先用301跳转到当前主URL。如果重复来自分页,注意分页不是简单重复,应保留分页可抓取,不要全部规范到第一页。判断依据是:该页面是否提供独立价值,是否可能被用户直接搜索到。
假设案例中,/sofa?color=gray和/sofa?color=grey只是拼写差异,应统一为一个参数值,另一个做301。而/sofa?sort=price只是排序,内容与主列表页相同,可考虑屏蔽抓取或加规范标签。这里要区分“可能原因”和“已经定位的原因”:只有当你确认两个URL返回的正文相似度超过阈值,才能说重复已经定位。
对确认重复的页面,优先使用301跳转;如果两个页面都需要保留给用户,可用rel="canonical"指向主版本。修改后不要立刻下结论,因为搜索引擎重新抓取和更新索引需要时间。比较前后数据时,要考虑季节、搜索需求变化和统计工具采集差异,不能承诺固定见效时间。验证方法是:过一段时间后,用站点查询看重复URL是否减少,用抓取工具确认规范标签是否生效。
?a=1&b=2与?b=2&a=1。下一步,从抓取工具导出全部URL,按标题和正文摘要分组,先处理完全相同的URL,再处理高度相似的参数页。每处理一组,记录修改前后的URL、状态码和规范目标,方便后续核对。