SEO 与 GEO
robots.txt
Robots Exclusion Protocol
放在网站根目录,告诉搜索引擎和 AI 爬虫哪些路径可以抓取的规则文件。
robots.txt 是位于网站根目录的纯文本文件,按 User-agent 分组,用 Allow 和 Disallow 声明哪些路径允许或禁止抓取,并可以用 Sitemap 指向站点地图。该协议已在 2022 年成为 IETF 标准 RFC 9309。
规则按爬虫名称匹配,例如 Baiduspider、Bingbot,以及 GPTBot、ClaudeBot、Bytespider 等 AI 相关爬虫。遵守协议的爬虫会在抓取前读取这个文件;但它只是约定,不具备强制力,恶意采集程序可以无视它。
对企业网站来说,robots.txt 决定了内容能否进入搜索引擎和 AI 的视野。想在 AI 回答里被提及,就不应该一刀切屏蔽 AI 爬虫;同时后台、搜索结果页、测试环境等不希望公开的路径应当屏蔽。
常见事故是测试环境的「禁止全部抓取」规则被原样带到正式站上线,导致网站长期不被收录。另一个误区是用 robots.txt 隐藏敏感内容:它本身是公开可读的,真正的敏感页面应该用登录鉴权保护。
免费咨询
聊聊你的项目
留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。
- 一个工作日内回复
- 需求沟通免费,不强推方案
- 交付管理后台与文档,可自行维护