robot txt 的内容与技术协作,不是让内容人员写一份规则、技术人员上传就结束,而是双方共同确认三件事:哪些路径允许抓取、哪些路径必须屏蔽、屏蔽后用户是否仍能正常访问。常见误解是“只要 robot txt 里写了 Disallow,页面就会从搜索结果消失”。实际上,Disallow 只表示不希望爬虫抓取该路径,不等于禁止索引;如果其他页面仍链接它,或该 URL 已被收录,它仍可能出现在结果中。协作的目标是让内容意图与技术实现一致,而不是互相甩锅。
内容团队关心“这篇内容能不能被搜到”,技术团队关心“服务器会不会被爬垮”。robot txt 只作用于抓取环节,它告诉爬虫哪些路径可以请求、哪些不要请求。抓取之后是否索引、是否排名,还取决于页面本身、链接关系、内容质量和用户需求。把三者混在一起,就会出现“我明明屏蔽了,怎么还能搜到”的争论。正确的做法是先区分目标:如果是不想让内容被看到,应该用访问权限或删除内容;如果只是不想让爬虫浪费抓取配额,才用 robot txt 屏蔽路径。
以下步骤适合已有页面或项目在原有基础上改进,不要求推翻重来。
/search?q= 是站内搜索结果页,内容重复且无独立价值”。Disallow 按前缀匹配,写 Disallow: /admin 会同时挡住 /admin 和 /administer。如果只想挡目录,通常写成 Disallow: /admin/ 更精确。具体语法以目标搜索引擎的官方文档为准。假设某电商站有大量带排序参数的列表页,例如 /category?sort=price、/category?sort=new。内容方认为这些页面内容相似,想全部屏蔽;技术方担心屏蔽后商品链接减少。判断条件如下:
这里的判断依据是用户需求与内容独特性,而不是“技术说挡就挡”或“内容说留就留”。robot txt 是协作工具,不是单方决定。
可以按以下检查项逐条核对:
如果检查发现被屏蔽页面仍被索引,不要立刻断言是 robot txt 失效。可能原因包括:该 URL 被其他站点链接、已被索引且尚未更新、或屏蔽规则写错了路径。需要逐项排查,而不是直接改规则。
robot txt 的内容与技术协作,最终要落到一份双方都能看懂的路径清单上。建议在项目文档中记录每条规则的用途、负责人和复核时间。下次内容改版或技术调整时,先更新这份清单,再改文件。这样既能避免误屏蔽,也能让内容意图和技术实现保持一致。