llms.txt 是什么?怎么配置让 AI 引擎读懂你的网站?

一句话回答:llms.txt 是一个放在你网站根目录下的纯文本文件,用 Markdown 格式告诉 AI 爬虫你的网站结构、核心内容和权威信息源,让大模型在抓取你网站时能快速定位最有价值的内容。 配置它不需要写代码,10 分钟能搞定,但它能直接影响 AI 引擎怎么理解你的网站。

这事为什么值得你现在就做?CNNIC《生成式人工智能应用发展报告(2025)》里写得很直白:当前主流生成式人工智能产品中绝大部分都具备智能搜索功能,甚至豆包、元宝等产品在本质上已经逐渐成为”具备内容创作、办公助手等功能的搜索引擎浏览器”。换句话说,AI 引擎正在变成新的搜索入口,而 llms.txt 就是给这个新入口留的一张”内容地图”。

核心原则:llms.txt 的价值不在于让 AI 收录你,而在于让 AI 用最短路径找到你最值得被引用的内容——它解决的不是”有没有”,而是”好不好找”。

TL;DR:llms.txt 是 2024 年由 Jeremy Howard 提出的网站级 AI 内容索引协议,放在根目录,用 Markdown 格式列出你的核心页面、内容摘要和权威链接。配置三步走:建文件、写结构、提交验证。它能提升 AI 引擎抓取效率,但替代不了内容质量——Princeton GEO 论文实测,引用来源 +34.4% 才是提升 AI 引用率最强的策略。

阶段时间该看什么别碰什么
基础认知第 1 天llms.txt 标准格式、适用边界各种”保证被收录”的玄学工具
动手配置第 2-3 天你的 sitemap、核心页面清单把全部页面塞进去(没意义)
提交验证第 4-5 天各引擎的抓取反馈、搜索测试指望当天见效(这不现实)
持续优化每月引用来源变化、内容结构调整频繁改文件(会让爬虫困惑)

llms.txt 概念示意图:一个网站根目录下的文本文件如何被 AI 引擎理解

Ⅰ. llms.txt 到底是个什么东西?

llms.txt 的灵感来自 robots.txt。1994 年,站长们用 robots.txt 告诉搜索引擎爬虫”哪些能爬,哪些不能爬”。30 年后,AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 这些)的需求完全不同,它们不是要索引整个网页,而是要快速理解”这个网站讲什么、哪些内容最权威”。

llms.txt 就干这个。它放在网站根目录(比如 https://yoursite.com/llms.txt),用 Markdown 格式写清楚:

# 你的网站名

> 一句话描述你的网站是干什么的

## 核心页面
- [产品介绍](https://yoursite.com/product): 一句话说明这个页面讲什么
- [客户案例](https://yoursite.com/cases): 带具体数据的量化结果

## 权威内容
- [行业报告](https://yoursite.com/report): 2025 年行业白皮书

就这么简单。没有 XML 标签,没有复杂的 schema,就是纯文本。

但这里有一个关键点很多人搞混了:llms.txt 不是 sitemap 的替代品,也不是 SEO 的银弹。 它是给 AI 爬虫看的”内容地图”,而不是”内容本身”。Princeton 那篇 GEO 论文(arXiv:2311.09735)里测得很清楚:引用来源 +34.4%、统计数据 +32.1%、直接引语 +29.7% 才是提升 AI 引擎引用率最强的三大策略,而关键词堆砌几乎无效甚至有害。llms.txt 只是让 AI 更容易发现你的好内容,它替代不了内容本身。

我自己下场做 GEO 之前先测了一把,结果挺难看的:在豆包搜了 4 个核心提问词,抓回 25 条引用源,我的博客一篇都没被引用,0%。这个 0 不是坏事,它让我意识到,光有好内容不够,还得让 AI 知道怎么找到它。

为什么 AI 引擎需要专门的文件?

因为 AI 爬虫和传统搜索引擎爬虫的读取方式完全不同。传统爬虫会把你的整个页面抓回去,分析 HTML 结构、提取链接、建立索引。但 AI 爬虫更在意的是”语义理解”,它要判断你这篇文章在讲什么、值不值得引用、引用哪一段最合适。

问题在于,很多网站的 HTML 结构对 AI 极不友好:导航栏、广告位、评论区、动态加载的内容,这些噪音会干扰 AI 对核心内容的判断。llms.txt 相当于你主动告诉 AI:“别管那些乱七八糟的,重点看这几个页面,内容概要我都给你写好了。”

这就像你去一家大公司找人,与其在迷宫一样的办公楼里乱转,不如直接去前台拿一张公司地图。llms.txt 就是那个前台。

Ⅱ. 怎么配置?三步走,10 分钟搞定

框架流程图:核心方法与执行框架

配置 llms.txt 不需要技术背景,核心就三步:建文件、写结构、提交验证。

第一步:建文件,放在根目录

在网站根目录创建一个名为 llms.txt 的纯文本文件。注意几点:

如果你用的是 WordPress、Shopify 这类建站工具,直接通过文件管理器或 FTP 上传就行。如果是静态站,放 public 目录下再部署。

第二步:写结构,遵循标准格式

llms.txt 的格式很简单,但有几个规范要遵守:

# 网站标题

> 网站的一句话描述

## 核心内容区

- [页面标题](URL): 一句话描述这个页面的内容
- [另一个页面](URL): 这句话要写清楚 AI 能从这页拿到什么

## 权威来源区

- [报告/白皮书名称](URL): 为什么这个内容值得引用

关键规范:

  1. 用 Markdown 格式,但别用复杂语法,AI 爬虫要的是简洁清晰的解析
  2. 每条链接后面都要写一句话描述,这句话就是 AI 判断”这个页面值不值得引用”的依据。写得太笼统(“点击查看”)等于没写;写得太长(超过 50 字)反而稀释重点
  3. 按优先级排序,最重要的内容放最前面。AI 爬虫通常会先读文件头部的内容
  4. 别把全部页面塞进去,只放核心的、有引用价值的页面

这里有一个反直觉的点:llms.txt 不是越全越好,而是越精越好。 AI 引擎要的是”这个网站最值得引用的是什么”,不是”这个网站有哪些页面”。你把所有页面都列出来,等于没列。

第三步:提交验证,观察效果

配置完不是就完事了,你得验证 AI 引擎能不能读到。方法很简单:

  1. 在浏览器直接访问 https://yoursite.com/llms.txt,确认能正常打开
  2. 用 Google Search Console 的 URL 检查工具提交这个文件
  3. 在 Bing Webmaster Tools 里也提交一次
  4. 过几天后在豆包、DeepSeek、Kimi 里搜你网站的品牌词或核心业务词,看看 AI 答案里有没有出现你的内容

我自己 2026 年初做过一轮引擎实测,发现四个引擎的口味完全不同:豆包偏爱 CSDN、头条、搜狐,DeepSeek 偏爱知乎、CSDN、博客园,Kimi 偏爱知乎、36氪、虎嗅,秘塔偏爱学术、arXiv、官方文档。llms.txt 不是让所有引擎都引用你,而是让愿意引用你的引擎更容易找到你。

Ⅲ. 配置对了会怎样?配置错了会怎样?

对比数据图:关键数据与对比

先看配置对了的效果。

打个比方,假设你是一家工厂老板,客户在豆包上问”XX 设备哪家好”。AI 给的答案里没有你,客户就去了别人家,这不是假设,这是每天都在发生的事。但如果你在 llms.txt 里写清楚了你的核心产品页、技术参数、客户案例,AI 抓取时就能快速定位这些内容,把它作为引用来源。

Searchless 2026 Q1 报告里有个数字:AI 引擎日均查询量已突破 30 亿次,占整个搜索市场份额 38%。按这个增速算,再过一年,这个数字大概率翻过一半。AI 搜索的份额到 38% 意味着什么?意味着你每 3 个潜在客户里,就有超过 1 个在 AI 引擎上查你的产品信息。 而 llms.txt 是让 AI 引擎高效理解你网站的基础设施之一。

再看配置错了会怎样。最常见的错误有三个:

错误一:把 llms.txt 当成内容农场。 有人把每条链接描述都写成”最好的 XX 服务商""行业领先的 XX 产品”。AI 引擎读的是语义,不是形容词。Princeton 论文里说得很清楚,关键词堆砌对 AI 引用几乎无效甚至有害。你写得越像广告,被引用的概率越低。

错误二:只建文件不更新。 你的网站内容在变,llms.txt 也得跟着变。新写的核心文章全没列进去,AI 爬虫每次来读的都是旧地图。

错误三:忽略子域名。 如果你的网站在 m.yoursite.com 有独立移动站,或者 blog.yoursite.com 是独立博客,这些子域名需要各自的 llms.txt。AI 爬虫访问子域名时不会自动读主域的 llms.txt。

这里我要反对一个主流做法:市面上很多 SaaS 号称”一键生成 llms.txt”,我的建议是别用。原因很简单,llms.txt 的价值在于你对内容的判断,而不是格式的自动化。一个工具可以帮你生成格式,但它不知道你的哪篇产品文章最有说服力、哪个客户案例的数据最能打动客户。这些判断只有你自己能做。

Ⅳ. 配置完 llms.txt 之后,真正的 GEO 工作才开始

llms.txt 是基础设施,不是终点。配置完它,你的 GEO 工作才刚起步。

先给你一个 3 步执行清单(这套方法你自己就能复现):

本周:搜行业 5-10 个核心提问词,记录 AI 引擎的引用来源,做一张自己行业的平台地图。判断方法很简单,打开豆包、DeepSeek,搜你行业最常被问的 3 个问题,如果 AI 答案里没有你的品牌,你的客户已经在 AI 上找别人了。

下周:根据平台地图,挑 3 个优先平台开账号、研究规则。这里有个判断跟主流不太一样:先把 CSDN、头条、搜狐这 3 个做透再说,我自己抓过一组数据,2026 年 5 月在豆包搜 4 个核心提问词,共引用 45 条来源,国内中文平台占 71%,其中 CSDN 一家就占了 34%。这 3 个平台加起来占豆包国内引用源的近一半。新平台诱惑大,但精力分散等于全输。

下月:写一篇核心文章,按 TOP3 平台公式改 3 个版本发出去看推荐量。注意,不是一键分发,一篇文章在 5 个平台需要 5 个不同版本,标题、结构、字数、情绪强度都不同。一键分发等于一个版本铺所有平台,违背平台公式,每个平台都推不起来。

这里有个关键认知:AI 引擎不会凭空引用你,它只引用平台已经推荐你的内容。 你跟 AI 之间隔着一个平台推荐算法。链路是这样的:写内容→按平台公式改写→平台推荐→平台权重上涨→AI 爬虫高频抓取→被引用。很多人搞反了顺序,以为在官网发几篇文章 AI 就会来读,不是的,AI 通过平台发现你,不是直接发现你。

GEO 内容分发链路图:内容→平台改写→平台推荐→权重上涨→AI 抓取→被引用

衡量指标也得换:很多人做 GEO 算”我这篇文章被引用了几次”,这是错的指标。真正该追的是:目标行业的 50 个核心提问词里,各引擎答案里出现你网站或账号的次数占多少。哪怕单篇引用率低,每个核心词都能搜到你,你就赢了。把 GEO 当数据实验做,不当玄学做,每月用固定提问词在豆包、DeepSeek、Kimi 各跑一遍,记录你的出现次数和引用来源变化,按数据调整内容结构。

最后说一句丑话:llms.txt 配得再好,也替代不了内容本身。产品有问题、内容是编的、数据是凑的,按公式改得再好,也只是放大了垃圾的传播。今年 3 月 15 日央视 315 晚会曝光了”AI 投毒”产业链,皮包公司用 GEO 技术手段批量发虚假软文,AI 引擎抓取后把虚假产品推荐给真实用户。曝光后一批 GEO 代运营服务商连夜下架业务。这个剧本我见过太多次:SEM 时代虚假宣传被罚、信息流时代违禁词擦边被封号、短视频时代夸张话术被下架。每次整顿后,真做产品的反而活得更好。

有个土办法最管用:把你写的每一篇文章打印出来,递给 5 个真实客户,让他们逐字检查。按这个标准做内容,你不会被 315 盯上,还会成为 AI 引擎最爱引用的优质源。

把问题留给你:你的产品、内容、承诺,敢不敢让客户当面对质?敢,按方法干;不敢,先把产品做好。

一张表总结:

维度你的数据计算方式
当前引用率在豆包搜 4 个核心词,记录你的出现次数出现次数 ÷ 引用总条数
平台分布记录每条引用来自哪个平台按平台归类,算占比
核心词覆盖率50 个行业核心提问词里,各引擎答案中出现你的词数出现词数 ÷ 50
内容资产量已发布的、被 AI 引用的文章数每月统计一次

常见问题

问题:llms.txt 和 sitemap.xml 有什么区别? sitemap.xml 是给传统搜索引擎看的,列出网站所有页面让爬虫去索引;llms.txt 是给 AI 引擎看的,只列出核心内容和权威信息源。两者可以共存,不冲突。

问题:配置 llms.txt 会影响我的 SEO 排名吗? 目前没有证据表明 llms.txt 会直接影响传统搜索引擎排名。它的作用是提升 AI 引擎对你网站的理解效率,间接影响 AI 引用率。

问题:所有 AI 引擎都支持 llms.txt 吗? 不是。目前明确支持的主要是 GPTBot(OpenAI),其他引擎如 ClaudeBot、PerplexityBot 也在逐步跟进。但即使不被所有引擎支持,配置它也没有坏处。

问题:llms.txt 里能写多少条链接? 没有硬性限制,但建议控制在 20-30 条以内。写太多会稀释重点,AI 引擎反而找不到你最想让它看的内容。

问题:配置完 llms.txt 多久能看到效果? 取决于 AI 引擎的爬虫多久来抓一次你的网站。快的话一周内,慢的话一个月。别指望当天见效,这不现实。

延伸阅读

参考资料

  1. llms.txt 官方规范(Jeremy Howard 提案):https://llmstxt.org/
  2. Princeton GEO 论文(arXiv:2311.09735):https://arxiv.org/abs/2311.09735
  3. CNNIC《生成式人工智能应用发展报告(2025)》:https://cnnic.cn/n4/2026/0304/c88-11549.html
  4. Google Search Central 关于 AI 内容抓取说明:https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
  5. Searchless State of AI Search Q1 2026 报告:https://searchless.com/state-of-ai-search