llms.txt 提案:给大模型准备一份网站说明书

2024 年 9 月 3 日,Answer.AI 联合创始人 Jeremy Howard 提出 llms.txt 提案,建议网站在根路径放置一份 Markdown 文件,向大模型说明网站的核心内容和重要链接。

发生了什么

2024 年 9 月 3 日,Answer.AI 与 fast.ai 联合创始人 Jeremy Howard 在 Answer.AI 网站发布 /llms.txt 提案,并建立 llmstxt.org 介绍这一格式。提案的出发点是:大模型的上下文窗口有限,而把带有导航、广告和 JavaScript 的 HTML 页面转换成干净文本既费力又容易出错,由网站作者提供一份精选的内容索引更加可靠。

llms.txt 长什么样

  • 文件放在网站根路径,即 /llms.txt,使用 Markdown 格式,既方便人读也方便程序解析。
  • 以一个 H1 标题写网站或项目名称,这是唯一必需的部分。
  • 接着用引用块写一段简短摘要,说明网站的关键信息。
  • 之后用 H2 分节,列出重要页面的链接及简要说明;名为 Optional 的分节放次要内容,上下文紧张时可以省略。
  • 提案还建议为页面提供在原网址后加 .md 的干净 Markdown 版本。

和 robots.txt 有什么区别

robots.txt 告诉爬虫哪些地方能访问、哪些不能;llms.txt 则告诉大模型哪些内容最重要、从哪里读起。两者作用不同,不能互相替代。llms.txt 目前仍是社区提案,并不是正式的 Web 标准,各家 AI 产品是否读取、如何使用并没有统一承诺。

在国内语境下,豆包、DeepSeek、通义千问、Kimi 等 AI 助手的联网检索机制各不相同,也都没有公开承诺会读取 llms.txt。因此它更适合作为「顺手做好」的一项,而不是 GEO 的全部。真正决定能否被 AI 引用的,仍然是页面本身的内容质量、可访问性和可信度。

企业网站要不要做

部署 llms.txt 的成本很低,对于文档、产品和服务信息较多的网站,它也是一次整理内容结构的机会。建议把它当作补充手段:先确保 robots.txt 没有误拦 AI 爬虫、页面正文不依赖 JavaScript 渲染、关键页面有结构化数据,再补上 llms.txt。

大乐GEO 的免费检测工具可以检查网站是否提供 llms.txt 以及 AI 爬虫的访问情况。

来源:Answer.AI www.answer.ai/posts/2024-09-03-llmstxt.html

# llms.txt# GEO# AI 爬虫# 网站技术
免费咨询

聊聊你的项目

留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。

  • 一个工作日内回复
  • 需求沟通免费,不强推方案
  • 交付管理后台与文档,可自行维护
仅用于本次咨询联系,不会用于其他用途。