自建博客步骤-重复页面怎样排查:从交付结果倒推证据

📍 WDQWDWQD987AAAAA:216.73.216.84
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /d36f7d1f22eb.html
📄

自建博客步骤-重复页面怎样排查:从交付结果倒推证据

排查自建博客的重复页面,目标不是“找出一个罪魁祸首”,而是交付一份可核对的证据清单:哪些URL内容相同或高度相似、它们如何被生成、哪些被站内链接或站点地图暴露、搜索引擎实际抓取到哪些版本。先确定要交付什么,再倒推需要收集的资料、执行的任务、责任归属和验收标准,才能把重复页面从“感觉很多”变成“可以逐条处理”。

先定义交付结果:重复页面清单要包含哪些字段

一份可执行的重复页面清单,至少应包含以下字段,缺一项都会让后续处理失去依据:

验收标准可以设为:清单中每条URL都能回答“它为什么存在”和“为什么这样处理”。如果某条只能写“看起来重复”,说明证据还不够。

倒推必需资料:自建博客要先拿到哪几类数据

自建博客的重复页面往往来自程序配置,而不是编辑失误,所以资料要覆盖生成逻辑和暴露路径两个层面。

站点生成与路由资料

需要确认博客使用什么生成方式:静态生成器、动态CMS,还是两者混合。重点查看路由规则、永久链接格式、分类与标签页、归档页、分页规则、搜索页、作者页是否会自动生成。如果同一篇文章能通过/post/标题和/category/分类/标题两个路径访问,就属于需要记录的路由重复。

抓取与索引证据

用搜索引擎的站点查询指令查看已收录的URL,只能作为线索,不能当作完整清单。更可靠的做法是结合站点地图、站内链接抓取和服务器日志:站点地图说明你主动提交了什么,站内链接说明你主动推荐了什么,日志说明搜索引擎实际访问了什么。三者不一致的地方,往往就是重复页面的藏身处。

规范化与重定向配置

检查每个模板输出的<link rel="canonical">指向哪里,是否所有变体都指向同一个首选URL。再检查服务器或托管平台的重定向规则,确认末尾斜杠、大小写、www与非www、http与https是否收敛到唯一版本。这里要区分“可能原因”和“已经定位的原因”:页面返回200不代表它一定被当作重复内容处理,只能说明它可访问,需要继续看规范化和内链。

排查任务清单:按顺序执行并记录判断结果

  1. 选一组疑似重复的URL,先用无痕窗口分别打开,确认页面主体内容是否相同。如果只是模板相同、正文不同,不算内容重复。
  2. 查看每个URL的返回码和规范化标签。若返回200且规范化指向自己,同时内容与另一个URL相同,就标记为待处理重复。
  3. 在站内搜索该文章标题,记录哪些链接指向哪个版本。若导航、标签页、相关文章都指向非首选版本,优先修正内链。
  4. 检查站点地图中是否同时包含多个变体。若包含,先决定首选URL,再从站点地图移除或替换其余变体。
  5. 查看服务器日志中搜索引擎对变体的抓取频率。抓取频繁但未被收录的变体,可能是内链或站点地图持续暴露所致。
  6. 对确认重复的URL选择处理方式:内容相同且无独立价值时用301重定向到首选URL;无法重定向的参数变体可加规范化;仅排序或筛选参数可用规范化指向无参数版本。
  7. 修改后重新抓取或提交首选URL,并在随后一段时间观察日志和收录变化。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能把短期波动直接归因于这次修改。

责任与验收:谁来决定保留哪个版本

自建博客通常由博主同时承担内容和技术角色,但仍要把决定权写清楚。内容层面由熟悉文章价值的人决定首选URL;技术层面由能修改模板、重定向和站点地图的人执行;验收层面由同一人对照清单逐条确认。验收时重点看三件事:首选URL是否唯一且可访问,重复变体是否已重定向或规范化,站内链接和站点地图是否只暴露首选版本。

如果重复页面来自标签页和归档页,不要一律删除。先判断它们是否有独立检索价值:标签页能帮助读者按主题浏览时可以保留,但要确保每篇文章有唯一首选URL,标签页本身不复制全文。若标签页只是自动生成且内容单薄,可以考虑加规范化到相关分类页,或调整模板只输出摘要。

下一步:建立可重复的检查动作

完成一轮排查后,把上述字段做成固定表格,每次发布新文章或调整模板后抽查一组URL。重点确认新文章是否只生成一个首选路径、站点地图是否只包含该路径、内链是否指向它。这样重复页面排查就从一次性救火变成发布流程的一部分,后续出现问题时也能直接对照历史记录定位变化。

图1 图2

nginx