什么是 llms.txt

llms.txt 是一个放在网站根目录(例如 https://example.com/llms.txt)的纯文本文件,用 Markdown 格式向大语言模型说明这个网站是做什么的、哪些页面最重要、内容应该如何被理解。

它的定位不同于 robots.txt。robots.txt 回答的是「哪些路径可以抓」,llms.txt 回答的是「抓到之后应该重点看什么、怎么理解」。前者是准入规则,后者是内容导读。

对于 GEO 而言,llms.txt 的价值在于:AI 系统在面对一个陌生站点时,往往需要借助站内导航、摘要页和搜索接口去推断站点结构。一份清晰的 llms.txt 能显著降低这种推断成本。

llms.txt 的文件规范与写法

llms.txt 采用 Markdown 语法,约定结构如下:第一行是一个 H1 标题,写站点或品牌名称;紧接着是一段用 blockquote(大于号)开头的摘要,用一到两句话说明站点定位;之后是若干个 H2 小节,每个小节下列出该主题的重要页面链接,链接格式为「- [页面标题](URL):一句话说明」。

可选的补充文件是 llms-full.txt,它把站点核心内容整合成一个完整文档,供希望一次性读取全部内容的 AI 使用。对于内容量不大的站点,维护 llms-full.txt 的收益通常高于 llms.txt 本身。

实践中有三条关键约束:第一,链接必须是绝对 URL,相对路径会被解析器丢弃;第二,只包含你确实希望被引用和推荐的页面,不要把站点地图原样搬进来;第三,保持人工维护,一旦页面下线或改版必须同步更新,过期链接会损害可信度。

llms.txt 与 robots.txt、sitemap.xml 的分工

三者面向的对象完全不同。robots.txt 面向所有爬虫,用 Allow 和 Disallow 控制抓取权限,是强制性的准入声明。sitemap.xml 面向搜索引擎,用 XML 列举全部可索引 URL 及更新频率,解决的是覆盖问题。llms.txt 面向大语言模型,用自然语言做内容导读,解决的是理解问题。

一个常见的错误是把 llms.txt 当成 SEO 排名因素。它不参与传统搜索排序,也不会让 Google 更快收录页面。它的作用场景是:当 AI 系统需要在有限上下文窗口内判断该读哪些页面时,提供一份人工编排的优先级清单。

另一个常见错误是在 llms.txt 里堆砌关键词。这份文件的读者是模型而非关键词匹配器,堆砌会直接降低它被采信的概率。

llms.txt 真的有用吗:现状与争议

需要客观说明:截至 2026 年,主流 AI 平台并未公开承诺会读取或优先采信 llms.txt。它目前属于社区推动的约定,而非被广泛实现的工业标准。已经有部分 AI 应用、开发工具和内容聚合服务开始支持,但覆盖面仍不确定。

因此合理的投入策略是:把它当作低成本、高确定性的补充动作,而不是 GEO 的核心抓手。写一份 llms.txt 的成本通常在半小时以内,即使未来未被广泛采用也不会产生负面影响;但不应指望仅靠它就显著提升 AI 提及率。

真正决定 AI 是否引用你的,仍然是可验证的事实密度、结构化数据的完整度、页面可被抓取和解析的程度,以及跨来源的一致性。llms.txt 只是在这些基础之上减少模型的理解摩擦。

一份可直接复用的 llms.txt 模板

下面是一份适用于多数 B2B 与内容型站点的模板结构,按实际链接替换即可:

H1 写品牌名与一句话定位;摘要区块写目标受众、核心产品、服务行业;随后分四个小节:核心产品页(3 到 5 个重点页面)、方法与指南(你最具权威性的长文)、数据与报告(含一手数据的页面)、关于我们(公司背景、团队、联系方式)。

每个链接后面的一句话说明应当写成「这个页面能回答什么问题」,而不是「这个页面的标题是什么」。例如「定价与套餐对比:回答各档位包含的分析额度与适用场景」,比「定价页」有效得多。

如何验证 llms.txt 是否生效

第一步是可达性验证:用浏览器或 curl 直接访问根目录下的 llms.txt,确认返回 200、Content-Type 为 text/plain 或 text/markdown,且没有被 CDN 或重定向拦截。

第二步是解析验证:检查 Markdown 结构是否规范,H1 是否唯一,链接是否为绝对 URL 且均可访问。可以用任意 Markdown 解析器快速校验。

第三步是效果验证:这一步无法直接观测,只能通过 GEO 指标间接判断。用 Broccoli AI GEO 对同一组提问做周期性采样,对比发布 llms.txt 前后的提及率与引用率变化,并结合竞品同期表现排除行业整体波动的影响。单次数值波动不应作为结论,至少需要连续三轮采样。