一句话定义:llms.txt 是放在网站根目录下的一份 Markdown 纯文本文件,用简短的说明加一组带注释的链接,告诉大语言模型(LLM)这个站点是干什么的、哪些页面值得优先读、哪些可以跳过。
它解决什么问题
搜索引擎和模型抓网页时看到的都是 HTML:导航栏、广告、页脚、弹窗层层包裹,真正的正文被埋在中间。模型想要的是干净的知识,网页给的却是一间装修过度的房子。llms.txt 相当于房主提前贴在门口的一张纸条:客厅(核心文档)随便看,储藏间(登录页、用户协议)不用进;另外厨房里还有一份更完整的清单(约定中常见的 llms-full.txt,把关键内容拼成一整篇),赶时间就只读它。
文件本身很简单:一个一级标题写站点名,一句引用写简介,然后按「必读」「可选」分节,每行是一个 Markdown 链接加一小句说明。那句说明才是关键——它回答了「这个页面能解决什么问题」,比单纯的链接清单有用得多。
和相邻概念的区别
| 文件 | 给谁看 | 作用 | 有强制力吗 |
|---|---|---|---|
| robots.txt | 爬虫程序 | 允许/禁止抓取哪些路径 | 行业惯例,多数爬虫遵守 |
| sitemap.xml | 搜索引擎 | 列出站点有哪些页面 | 只是建议 |
| llms.txt | 大模型及其工具链 | 说明站点内容与页面优先级 | 纯约定,读不读由对方决定 |
一句话概括:robots.txt 管「能不能进」,sitemap 管「有哪些房间」,llms.txt 管「先看哪间、每间在讲什么」。
对实际工作的意义
对做开发者文档、产品帮助中心、内容站的人来说,加一份 llms.txt 成本很低:不用改页面结构,不影响正常用户访问,却可能在 AI 搜索或智能助手引用内容时,让对方更快抓到你的权威页面,而不是三年前的旧博客。
但有三点要想清楚。
第一,它是社区提出的约定,不是正式标准,各家模型厂商是否读取、如何读取,以官方说明为准;不读也不会报错,只是没有效果。
第二,它不是访问控制。写进 llms.txt 的页面照样会被普通爬虫抓走。不想公开的内容,唯一的办法是别放到公网上。
第三,它不替代 SEO。它只是一份给机器看的导读,真正决定内容会不会被引用的,仍然是信息本身是否准确、新鲜、可访问。把它当成「AI 时代的 SEO 银弹」,多半会失望。
