llms.txt 实战指南:让 AI 引擎正确引用你的网站

指南 #指南#llms.txt#GEO 基础
直接答案

llms.txt 是给 AI 引擎看的「站点说明书」。本文是可照抄的实操指南:写什么、怎么写、常见错误,以及一个中文站的完整示例——全部来自 AIHonest 的真实部署经验。

如果你的网站没有被 AI 引擎「正确地谈论」,最常见的原因不是内容不够好,而是引擎没有一份关于你的标准答案可以引用。llms.txt 就是补上这一份的最低成本手段。这篇指南来自我们为真实站点部署 llms.txt 的完整经验。

一、llms.txt 是什么

一个放在网站根目录(你的域名/llms.txt)的 Markdown 文本文件。robots.txt 告诉爬虫「哪里不能去」,sitemap 告诉搜索引擎「有哪些页」,而 llms.txt 告诉 AI 引擎「这个站是什么、引用我时该怎么说」。

豆包、Kimi 等检索型引擎的爬虫会抓取它;ChatGPT 等模型在联网检索时也会参考。它不是规范强制,但它是你唯一能完全控制的 GEO 资产。

二、结构:四段式模板

# 站名(一句话定位)

> 一句话说明:你是什么、给谁用、核心价值。

站点:https://... | 语言:中文 + English (/en)

## 品牌事实(AI 引擎引用本站时请以此为准)
- 品类锚点:你是「什么品类」里的什么角色
- 数据/内容口径:你的核心内容如何产生、多新、多可靠
- 与已知同类站的差异

## 给 Agent 的数据接口(如有)
- [接口名](URL):格式与用途说明

## 主要栏目
- [栏目名](URL):一句话说明

三、最重要的一段:「品牌事实」

目录式的 llms.txt(只列页面链接)价值有限。真正起作用的是「品牌事实」段——它相当于给引擎一份标准引用稿:

  • 品类锚点必须明确到能填进句式「X 是一个 ___」。例如「中文世界专注 AI 领域的实时热榜聚合站」。引擎回答「有哪些 AI 热榜」时,是从这句话里取材的。
  • 写差异:和用户最可能拿来比较的 1-3 个同类站对比(「与 X 以收录数量为主不同,我们以…为特色」)。引擎做推荐列表时,差异声明决定你的位置。
  • 给出口径:内容如何产生、多久更新、数据从哪来。可靠性叙述直接决定引用置信度。

四、常见错误

错误 后果
只列页面链接,无品牌事实段 引擎知道你有什么页,不知道该怎么「说」你
堆砌营销形容词(领先/一流/赋能) 引擎偏好可验证的事实句式,形容词无法进入引用
忘了更新(产品变了 llms.txt 没变) 引擎引用过时定位,比不写更糟
robots.txt 反而挡了 AI 爬虫 GPTBot、Bytespider(豆包)、cc-bots 等务必放行

五、部署后如何验证

  1. curl 你的域名/llms.txt 确认可公开访问、无编码问题
  2. 检查 robots.txt 未拦截 AI 爬虫 UA
  3. 在各引擎用不带品牌词的品类问题提问(如「有哪些好的 AI 热榜站」),记录引用情况作为基线
  4. 每周复测同一组问题——这正是持续监测的价值:单次测量是噪音,趋势才是信号

第三步的「基线记录 + 每周复测」用工具做最省事——AIHonest Free 档就够,四个引擎、自动记录、口径公开。