排查自建博客的重复页面,目标不是“找出一个罪魁祸首”,而是交付一份可核对的证据清单:哪些URL内容相同或高度相似、它们如何被生成、哪些被站内链接或站点地图暴露、搜索引擎实际抓取到哪些版本。先确定要交付什么,再倒推需要收集的资料、执行的任务、责任归属和验收标准,才能把重复页面从“感觉很多”变成“可以逐条处理”。
一份可执行的重复页面清单,至少应包含以下字段,缺一项都会让后续处理失去依据:
验收标准可以设为:清单中每条URL都能回答“它为什么存在”和“为什么这样处理”。如果某条只能写“看起来重复”,说明证据还不够。
自建博客的重复页面往往来自程序配置,而不是编辑失误,所以资料要覆盖生成逻辑和暴露路径两个层面。
需要确认博客使用什么生成方式:静态生成器、动态CMS,还是两者混合。重点查看路由规则、永久链接格式、分类与标签页、归档页、分页规则、搜索页、作者页是否会自动生成。如果同一篇文章能通过/post/标题和/category/分类/标题两个路径访问,就属于需要记录的路由重复。
用搜索引擎的站点查询指令查看已收录的URL,只能作为线索,不能当作完整清单。更可靠的做法是结合站点地图、站内链接抓取和服务器日志:站点地图说明你主动提交了什么,站内链接说明你主动推荐了什么,日志说明搜索引擎实际访问了什么。三者不一致的地方,往往就是重复页面的藏身处。
检查每个模板输出的<link rel="canonical">指向哪里,是否所有变体都指向同一个首选URL。再检查服务器或托管平台的重定向规则,确认末尾斜杠、大小写、www与非www、http与https是否收敛到唯一版本。这里要区分“可能原因”和“已经定位的原因”:页面返回200不代表它一定被当作重复内容处理,只能说明它可访问,需要继续看规范化和内链。
自建博客通常由博主同时承担内容和技术角色,但仍要把决定权写清楚。内容层面由熟悉文章价值的人决定首选URL;技术层面由能修改模板、重定向和站点地图的人执行;验收层面由同一人对照清单逐条确认。验收时重点看三件事:首选URL是否唯一且可访问,重复变体是否已重定向或规范化,站内链接和站点地图是否只暴露首选版本。
如果重复页面来自标签页和归档页,不要一律删除。先判断它们是否有独立检索价值:标签页能帮助读者按主题浏览时可以保留,但要确保每篇文章有唯一首选URL,标签页本身不复制全文。若标签页只是自动生成且内容单薄,可以考虑加规范化到相关分类页,或调整模板只输出摘要。
完成一轮排查后,把上述字段做成固定表格,每次发布新文章或调整模板后抽查一组URL。重点确认新文章是否只生成一个首选路径、站点地图是否只包含该路径、内链是否指向它。这样重复页面排查就从一次性救火变成发布流程的一部分,后续出现问题时也能直接对照历史记录定位变化。