llms.txt 教程:如何把你的内容交给 AI 搜索引擎——新手分步指南
引言:为什么你的网站需要 llms.txt
几年前,用户找到你内容的路径很简单:在搜索引擎里输入关键词,看到一个链接列表,点击进去。到了 2026 年,情况完全不同了。越来越多的人向 AI 助手和 AI 搜索引擎提问,而这些系统会自己去读取网站、转述内容并引用来源。如果模型没搞懂你的网站是做什么的,它要么直接忽略,要么转述得面目全非。而 llms.txt 文件解决的正是这个问题:它告诉语言模型你有什么内容、最重要的东西在哪里。
这份实战指南将带你从一张白纸走到域名下真正可用的 llms.txt 文件。不搞空谈理论,每一步都有具体的操作和验证方法。
你最终会得到什么
- 一份放在网站根目录、通过 你的域名/llms.txt 就能打开的 llms.txt 文件。
- 一份包含关键页面完整文本的扩展版 llms-full.txt。
- 清楚哪些页面该展示给 AI,哪些不该。
- 一套验证机制:你知道文件能被读取,也知道 AI 爬虫确实找得到它。
- 为后续开展生成式优化(即让品牌出现在 AI 回答中)打下的基础。
这份指南适合谁
适合企业主、营销人员、流量操盘手和开发者——只要你想让自己的产品、落地页或博客正确地出现在 AI 助手的回答里。如果你有网站,会往上上传文件,或者知道谁能帮你做,那你的技能就够用了。文末还有一个专门板块,写给想自动化流程并通过日志监控 AI 爬虫行为的朋友。
需要提前了解什么
- 你的网站是怎么搭的:网站构建器、WordPress 之类的 CMS,还是自己写的代码。
- 网站文件放在哪里、怎么访问:主机控制面板、FTP、代码仓库。
- Markdown 的基本概念:用井号做标题、用短横线做列表、用方括号和圆括号放链接。不熟也没关系,我们会用例子讲清楚。
需要多长时间
30 个页面以内的网站,做个最简版大约一小时。完整版包括 llms-full.txt、验证和服务器响应头设置,大概需要两到三个小时。如果是大型目录和文档站,预留一天,但效果也会明显更好。
前期准备
好的准备比任何小技巧都省时间。照着下面的清单过一遍,确认东西都在手边。
需要的工具和权限
- 网站文件的访问权限。可能是带文件管理器的主机控制面板、FileZilla 之类的 FTP 客户端、服务器的 SSH 访问权限,或者项目部署用的代码仓库。确认账号密码还有效,你确实能在网站根目录里创建文件。
- 文本编辑器。任何能保存纯文本、不带格式的都行:Visual Studio Code、Sublime Text、Windows 上的 Notepad++、Mac 上切到纯文本模式的 TextEdit。Word 和 Google Docs 不行,它们会加入看不见的字符和智能引号。
- 网站页面清单。从 sitemap.xml、CMS 后台或任意爬虫工具(比如 Screaming Frog)导出。有一张包含每个页面地址和标题的表格就够了。
- 统计数据访问权限。Yandex Metrica、Google Analytics 或服务器日志能帮你判断哪些页面对用户真正重要。
- 浏览器和 curl 工具。curl 在 Mac 和 Linux 上预装,Windows 10 和 11 的命令行里也有。检查服务器响应头时会用到它。
系统要求
没有。llms.txt 文件就是普通文本。不需要 PHP、不需要数据库、不需要服务器上的额外模块。唯一的要求:服务器能从域名根目录提供静态文件,任何主机都能做到。
需要下载和安装什么
- 代码编辑器,如果你还没有的话。推荐 Visual Studio Code:免费,能高亮 Markdown,还能显示看不见的字符。
- FTP 客户端,如果主机面板没有文件管理器。
- 可选:Python 3 和 llms-txt 包,用于从现成文件生成上下文。进阶板块会用到,基础设置不需要。
备份
创建 llms.txt 不会改动网站现有文件,所以风险极小。但在设置服务器响应头那一步,你会编辑配置,比如 .htaccess 文件或 Nginx 配置。动手之前,务必把当前版本的配置文件下载到电脑上,标注日期保存好。如果改完网站打不开了,你直接把旧版本传回去就行。
建议: 在电脑上建一个单独的项目文件夹,比如 site-llms。里面存页面表格、文件草稿和配置备份。半年后要更新 llms.txt 时,你会感谢自己的。
基础概念:llms.txt 是什么、怎么工作
动手之前,用大白话解释几个术语。花五分钟,后面就全明白了。
llms.txt 是什么
llms.txt 是一个 Markdown 格式的文本文件,放在网站根目录。里面包含项目简介和一份结构化的链接列表,指向关键页面并附上说明。名字读作“诶勒-诶勒-诶姆-诶斯-踢-诶克斯-踢”:LLMs 就是 Large Language Models,大语言模型。
这个标准由 Answer.AI 公司的开发者 Jeremy Howard 在 2024 年秋天提出。想法很简单:语言模型的“注意力窗口”有限,处理满是菜单、广告、脚本和弹窗的臃肿 HTML 页面效果很差。llms.txt 文件给它们一张干净的内容地图,去掉噪音。此后,数百家公司开始采用这个格式,尤其在文档和开发领域,到了 2025-2026 年,它已经成了网站为 AI 做准备的基础环节之一。
llms.txt 不是什么
这一点要一开始就搞清楚,别把工具搞混了。
- 它不是禁止文件。它不封锁也不允许任何东西。爬虫的访问规则写在另一个文件里,我们博客里有专门的文章讲那个。这里不涉及。
- 它不是 sitemap.xml 意义上的网站地图。网站地图列出所有待索引的地址。llms.txt 文件恰恰相反,它筛选出最重要的内容,并解释每个链接的意义。
- 它不保证你能出现在 AI 的回答里。文件帮助模型理解内容,但不能强迫它们引用。
两个文件:llms.txt 和 llms-full.txt
标准提出两个实体:
- llms.txt —— 简要导航。标题、摘要、带链接的章节。通常 20 到 200 行。
- llms-full.txt —— 关键页面的完整内容,合并成一个文本。模型或工具可以一次性加载,不用逐个点链接。
第一个文件是必需的,第二个是建议的。两个我们都会做。
文件结构长什么样
规范规定了严格的结构顺序:
- 一级标题,写项目名称。这是唯一必需的要素。
- 引用块,写简短描述:一到三句话,说明这是什么网站、对谁有用。
- 可选的段落,补充细节:特点、限制、背景。
- 二级章节,每节带链接列表。行格式:短横线、方括号里的链接名称、圆括号里的地址、冒号、简短说明。
- 可选的名为 Optional 的章节。如果模型上下文空间不够,可以跳过这里的链接。
这是一个最小示例,我们会反复用到:
# 项目名称
> 一到两句话:这是什么、对谁有用。
## 文档
- [快速开始](https://example.com/docs/start): 如何在 10 分钟内上手
- [套餐价格](https://example.com/pricing): 价格和额度限制
## Optional
- [更新日志](https://example.com/changelog): 有哪些更新这里的换行符只是示意;真实文件里就是换行。看起来不难,对吧?主要工作不在语法,而在选页面和写说明。这就是我们接下来要做的。
2026 年谁在读 llms.txt
实话实说:不是所有人,也不统一。这个格式被开发者用的 AI 工具、带 AI 助手的代码编辑器、一些 AI 搜索引擎,以及在用户提问时访问网站的智能体积极使用。最大的搜索公司没有官方确认支持。尽管如此,这个标准已经成了行业通用语言,文件维护成本几乎为零,而没有它肯定没好处。另外还有个附带好处:做 llms.txt 的时候,你会顺手把自己的内容理清楚。
第 1 步:内容审计和挑选给 AI 的页面
本阶段目标: 得到一张 10-50 个页面的表格,这些页面将进入 llms.txt,每个页面标注所属章节并写好说明草稿。
新手最常见的错误就是什么都往里塞。模型拿到上千行,找不到重点,效果比没有文件还差。你的任务是挑出真正解释产品、回答受众问题的内容。
操作步骤
- 打开你提前准备好的网站页面清单表格。如果没有,在浏览器里打开 你的域名/sitemap.xml,把地址复制到电子表格里。
- 添加列:“标题”“章节”“给 AI 的说明”“优先级”。
- 逐行问自己:“如果有人问 AI 关于我产品的问题,这个页面能帮它给出准确回答吗?”能就标优先级 1。页面有用但次要,标 2。其余标 0。
- 优先级 1 必须包括:描述产品的主页、价格或套餐页、“关于我们”页、文档或说明章节、联系页和使用条款。电商网站还要包括分类页和配送页。流量或联盟项目还要包括合作计划条件页和 offer 说明。
- 打开统计数据。看看过去三个月访问量最高的 20 个页面。如果有没进优先级 1 的,重新考虑:用户认为它们重要。
- 排除功能页面:购物车、个人中心、搜索结果、分页页、带 UTM 标记的重复页、过期活动页。
- 把优先级 1 和 2 的页面分成三到六个章节。常见名称:“产品”“文档”“价格”“博客”“支持”“案例”。章节名称写到“章节”列。
- 为每个选中的页面写一份 8-15 字的说明草稿。别抄 meta 描述:那是写给搜索结果页里的用户看的。要写得让模型明白什么时候该打开这个页面。差:“我们的套餐”。好:“各国移动代理的价格、流量额度和 IP 切换条件”。
建议: 想象一个刚入职的客服,需要在一分钟内搞清楚该把客户引导到哪里。如果你的说明能让他明白,那对语言模型也够用。
预期结果
你有一张表格,过滤出了优先级 1 和 2 的页面,每个都归入章节并附有说明草稿。一般网站通常 10-50 行,大型文档站最多 200 行。
检查: 只看“给 AI 的说明”这一列,从上往下读,别管地址。如果光看说明就知道网站做什么、产品怎么构成,审计就做对了。
可能遇到的问题
- 优先级 1 的页面太多。超过 60 个说明你不够严格。再问自己:没有哪个页面模型就没法正确回答?其余移到优先级 2 或 Optional 章节。
- 内容零散,没有清晰的章节。这说明网站结构有问题。对 llms.txt 来说,先创建逻辑分组,即使菜单里没有。之后可以再调整导航。
- 页面禁止索引或只能登录后访问。别放进去。模型反正读不到,你只会给它错误链接。
第 2 步:创建 llms.txt 文件及其框架
本阶段目标: 创建文件名和编码都正确的文件,填好标题、摘要和背景段落。
操作步骤
- 打开文本编辑器。通过菜单“文件”和“新建文件”或 Ctrl+N 创建新文件。
- 立刻保存:菜单“文件”,“另存为”。文件名输入栏里精确输入 llms.txt,全小写。检查编辑器没加第二个扩展名,比如 llms.txt.txt。Windows 上要在资源管理器里开启显示扩展名。
- 确认文件编码是 UTF-8 无 BOM。在 Visual Studio Code 里,编码显示在窗口右下角;点它,选“以编码保存”,选 UTF-8。在 Notepad++ 里打开“编码”菜单,选“以 UTF-8 编码”,不带 BOM 标记。
- 第一行写一级标题:井号、空格、项目名称。比如:# MobileProxy.space。用客户熟悉的品牌名,不要口号。
- 留一个空行。
- 写引用块:大于号、空格、一到三句说明项目本质。回答“这是什么”“对谁有用”“有什么不同”。比如:> 面向营销人员、流量操盘手和开发者的运营商 IP 移动代理租赁服务。支持通过链接和 API 轮换地址,兼容反检测浏览器和抓取工具。
- 留一个空行。
- 加一到三个普通段落,写能帮模型不犯错的背景。适合放:服务区域、网站支持语言、服务不做什么、信息有效期。比如:“价格以卢布计价,每月更新。网站提供俄语和英语版本;英文版位于 /en/ 子目录。服务提供基础设施,不提供广告投放设置服务”。
- 按 Ctrl+S 保存文件。
注意: 文件里必须只有一个一级标题,而且必须是第一行。如果你在前面加注释、带空格的空行或第二个标题,严格遵循规范的工具可能拒绝解析文件。
怎么写摘要才有用
引用块是文件里最被常读的地方。模型在转述你的网站是什么时,最常用的就是它。几条规则:
- 不要评价性词语。“最好”“独特”“第一”不传递信息,还会降低模型对全文的信任。
- 用具体代替抽象。不是“商业解决方案”,而是“租赁俄罗斯和欧洲运营商 IP 的移动代理”。
- 明确写出目标受众。模型会拿它和用户的问题对照。
- 控制在 300-400 字符以内。太长模型可能截断。
建议: 写三个摘要版本,逐个贴到任何可用的 AI 助手里,问:“这家公司做什么、对谁有用?用一句话回答。”选助手回答最准确的那个。
预期结果
llms.txt 文件已在磁盘上,以 UTF-8 保存,以一个标题开头,引用块里有摘要,还有一到三个背景段落。还没有链接章节,那是下一步。
检查: 把文件拖到浏览器窗口里打开。你应该看到纯文本,西里尔字母位置没有乱码。如果俄文字母位置显示问号或方框,说明编码选错了——回到第 3 点。
可能遇到的问题
- 编辑器自动把引号换成“智能”引号,或把短横线换成长破折号。在设置里关掉自动替换,或者用代码编辑器。在 Markdown 链接里这类字符会破坏标记。
- 文件保存成了 llms.txt.txt。通过资源管理器或 Finder 重命名,先开启显示扩展名。
第 3 步:填写章节和链接
本阶段目标: 把表格里选好的页面用正确语法搬进文件,按章节分组,并加上 Optional 块。
操作步骤
- 把 llms.txt 和第 1 步的表格并排打开。
- 在背景段落后留一个空行,写第一个章节的二级标题:两个井号、空格、名称。比如:## 产品。
- 留一个空行。
- 为该章节的每个页面写一行列表,严格按模板:短横线、空格、左方括号、页面名称、右方括号、左圆括号、带协议的完整地址、右圆括号、冒号、空格、说明。比如:- [移动代理套餐](https://example.com/pricing): 按国家和运营商的价格、流量额度、IP 轮换条件。
- 使用绝对地址,以 https 开头。像 /pricing 这样的相对路径很多工具无法展开,因为它们是在浏览器环境之外读文件的。
- 链接名称取页面标题,但缩到五到八个字。说明取“给 AI 的说明”列。
- 每个章节重复第 2-6 点。章节顺序从最重要到次要:先产品和价格,再文档,再博客和案例。
- 章节内部也按重要性排序。每个章节的前三个链接被读得最多。
- 最后加一个章节 ## Optional。把优先级 2 的页面移进去:博客归档、更新日志、次要案例、招聘页。章节名称必须用拉丁字母写:Optional。这是规范的保留词。
- 保存文件。
建议: 如果网站有已经以纯文本形式提供内容的页面,比如 Markdown 版本或简单的文本文档页,链接到那些,而不是 HTML 版本。模型能拿到没有菜单和脚本的文本,理解得更好。
完整章节示例
## 文档
- [在反检测浏览器里连接代理](https://example.com/docs/antidetect): 分步配置配置文件、检查 IP 和常见错误
- [IP 切换 API](https://example.com/docs/api): 方法、请求参数、额度和 JSON 响应示例
- [连接格式](https://example.com/docs/formats): HTTP、SOCKS5、按用户名和按 IP 授权怎么写链接说明
冒号后面的说明是给模型的提示,告诉它什么时候该打开这个页面。提示越准,模型越能选对回答来源。规则很简单:
- 回答“里面是什么”,而不是“为什么该读”。不是“关于代理的有用文章”,而是“移动、住宅和服务器代理在速度、成本和封锁风险上的对比”。
- 用用户提问时的词语。如果客户问“怎么换 IP”,说明里就该有“IP 切换”。
- 不要重复链接名称。名称说“这是什么”,说明说“里面具体有什么”。
- 控制在一行以内。列表项内的换行会破坏解析。
预期结果
文件包含三到六个二级章节,每节 2 到 20 个带说明的链接,最后是 Optional 章节。总长度 20 到 200 行。
检查: 把文件内容贴到任意在线 Markdown 预览器,或在代码编辑器里打开预览。所有链接应该可点击,标题应该变大,列表应该带标记。如果某行显示成带括号的普通文本,说明那行语法有错。
可能遇到的问题
- 链接没变成可点击的。最常见的是短横线后忘了空格、漏了括号,或方括号和圆括号之间多了空格。那里不该有空格。
- 地址里有空格或西里尔字母。对地址编码:空格换成 %20,西里尔字符换成对应的百分号表示。更简单的办法是从浏览器地址栏复制地址,它已经编码好了。
- 说明里包含冒号。右圆括号后的第一个冒号被视为分隔符;说明内部后续的冒号可以接受,但为了避免混淆,最好改写。
第 4 步:创建 llms-full.txt 和页面的纯文本版本
本阶段目标: 汇总一份包含关键页面完整文本的扩展文件,让工具能一次请求加载全部内容。
这一步不是必需的,但对文档、说明和详细产品描述来说收益最大。如果说 llms.txt 是目录,那 llms-full.txt 就是整本书。
操作步骤
- 新建文件,以 llms-full.txt 为名保存,编码同样是 UTF-8。
- 把 llms.txt 里的一级标题和引用块复制到开头。两个文件的开头要一致。
- 对于每个优先级 1 的页面,在浏览器里打开,复制正文:标题、段落、列表、表格。别复制菜单、页脚、订阅表单、评论和广告块。
- 把文本粘到文件里,放在以页面名称为标题的二级标题下。页面内部的标题降一两个级别:网站上二级标题的内容,在文件里变成三级。这样能保持层级。
- 每块后面加一行来源地址,比如:来源: https://example.com/docs/api。这能帮模型引用具体页面。
- 页面块之间用空行和三个短横线(Markdown 标准水平分隔线)隔开。
- 表格转成带竖线的 Markdown 格式,或者结构简单的话转成列表。
- 删掉“点击这里”“继续阅读”“分享”之类的界面用语。在没有界面的文本里它们毫无意义。
- 保存文件。
注意: 别把客户个人数据、内部文档、优惠券和任何你不想在陌生人的 AI 助手回答里看到的信息放进 llms-full.txt。进了这个文件的东西,本质上就是公开了。
文本量该有多少
合理范围是 2 万到 30 万字符。太少,文件就没存在意义,llms.txt 就够了。太多,很多工具加载不了全部。内容多的话,做几个主题文件,比如 llms-full-docs.txt 和 llms-full-blog.txt,在 llms.txt 的单独章节里引用它们。
建议: WordPress 和大多数 CMS 都有插件和模块,能从已发布文章自动生成 llms.txt 和 llms-full.txt。在扩展目录里搜“llms txt”就能找到。自动生成能省好几个小时,但结果一定要手动检查:插件经常什么都往里塞,包括标签页和草稿。
预期结果
llms-full.txt 包含和 llms.txt 一样的标题和摘要,然后是关键页面的完整纯文本,并标注来源。
检查: 打开文件,随机读中间一段。如果能看出说的是哪个页面,文本读起来没有界面垃圾,就没问题。如果出现“菜单 主页 价格 联系”这样的碎片,清掉它们。
可能遇到的问题
- 从浏览器复制时标题结构丢失。分段复制,手动加井号,或者用浏览器扩展把页面保存成 Markdown。
- 文件变成了几兆。拆成主题部分,或者只保留优先级 1 的页面。
第 5 步:把文件上传到服务器
本阶段目标: 把 llms.txt 和 llms-full.txt 放到网站根目录,让它们能通过 你的域名/llms.txt 打开。
方法取决于你的网站是怎么搭的。下面是四种常见场景。选适合你的。
方案 A:带文件管理器的主机面板
- 用主机商邮件里的账号密码登录控制面板。
- 找到名为“文件管理器”“文件”或“文件管理器”的版块。
- 进入网站根目录。通常叫 public_html、www、htdocs 或域名名称。判断标准:里面放着 index.html 或 index.php,以及已有的 sitemap.xml。
- 点击“上传”按钮。会弹出文件选择窗口。
- 从电脑选 llms.txt 和 llms-full.txt,确认上传。等进度条完成。
- 确认文件出现在列表里,和 index 文件并列,权限是 644,即所有人可读、只有所有者可写。通常面板会自动设好这个权限。
方案 B:FTP 客户端
- 打开 FileZilla 或类似客户端。
- 在顶部面板输入主机商邮件里的主机、用户名、密码和端口。点“快速连接”。
- 在窗口右侧按同样的特征找到网站根目录。
- 在左侧找到电脑上存文件的文件夹。
- 把 llms.txt 和 llms-full.txt 从左拖到右。窗口底部会出现传输队列;等它清空。
- 右键点击已上传的文件,选“文件权限”,确认值是 644。
方案 C:从代码仓库自动部署的网站
- 确定发布静态文件的文件夹。大多数框架里它叫 public 或 static,位于项目根目录。
- 把 llms.txt 和 llms-full.txt 放到这个文件夹里,和 favicon、robots 文件并列。
- 提交更改并推送到部署用的分支。
- 等构建完成。时间取决于项目,通常一到十分钟。
方案 D:网站构建器
这里比较麻烦:不是每个构建器都允许在域名根目录添加任意文件。操作步骤:
- 打开网站设置,找到“文件”“文件上传”“SEO”或“高级”之类的版块。
- 如果能上传文件并指定路径,就指定路径 /llms.txt。
- 如果不行,但有重定向或规则设置,创建规则:对 /llms.txt 的请求以 200 或 301 状态码重定向到已上传的文件。有些平台叫“转发”或“路由规则”。
- 如果这也不行,联系构建器客服,要求把文本文件放到根目录。说法:“需要把静态文件 llms.txt 放在 域名/llms.txt,类型为 text/plain”。
注意: 文件必须放在域名根目录,不是子文件夹。像 域名/files/llms.txt 这样的地址工具找不到,因为它们按固定路径查找文件,就像 favicon 或 sitemap。
建议: 如果网站跑在多个域名或子域名上,比如主域名和单独的文档子域名,每个都要放 llms.txt。每个域名的文件只描述自己的内容,链接章节里可以指向相邻域名。
预期结果
在浏览器地址栏输入 你的域名/llms.txt,能看到你的文本。llms-full.txt 也一样。
检查: 用无痕模式打开两个地址,排除浏览器缓存。你应该原样看到文件文本:带井号的标题、带大于号的引用、带短横线的列表。如果浏览器提示下载而不是显示,问题不大,下一步我们会处理。
可能遇到的问题
- 404 错误。文件不在根目录,或名字写错了。检查大小写:在 Linux 服务器上 LLMS.txt 和 llms.txt 是不同的文件。
- 403 错误。权限不对。通过文件管理器或 FTP 设为 644。
- 更新后打开的是旧版本。主机或 CDN 缓存。在面板里清缓存,或等缓存过期。
- 西里尔字母显示不对。服务器没声明编码。下一步解决。
第 6 步:设置服务器响应头
本阶段目标: 让服务器以正确的内容类型和编码提供文件,允许来自浏览器工具的 AI 智能体访问,并且不要缓存文件太久。
不是每个人都需要这一步。如果第 5 步检查显示俄文字母正常,可以只看下面的检查部分。但正确的响应头能提高工具无意外处理文件的概率。
需要哪些响应头
- Content-Type: text/plain; charset=utf-8 或 text/markdown; charset=utf-8。前者更通用。
- Cache-Control: max-age=3600 —— 缓存一小时。足够减轻负载,更新也能很快生效。
- Access-Control-Allow-Origin: * —— 允许其他域名的网页应用读取文件。有些 AI 工具直接在浏览器里运行,没有这个头就加载不了文件。
通过 .htaccess 为 Apache 设置
- 把网站根目录的 .htaccess 文件下载到电脑,保存副本。如果没有,新建一个空的。
- 用编辑器打开,在末尾加一个块:
<Files "llms.txt">
Header set Content-Type "text/plain; charset=utf-8"
Header set Cache-Control "max-age=3600"
Header set Access-Control-Allow-Origin "*"
</Files>
<Files "llms-full.txt">
Header set Content-Type "text/plain; charset=utf-8"
Header set Cache-Control "max-age=3600"
Header set Access-Control-Allow-Origin "*"
</Files>- 保存并把文件传回网站根目录,替换旧的。
- 立刻打开网站主页。能打开就没事。如果看到 500 错误,马上把保存的副本传回去:主机可能没开启 headers 模块。然后联系主机客服,请求开启 mod_headers。
为 Nginx 设置
- 用 SSH 连接服务器。
- 复制网站配置文件,通常在 /etc/nginx/sites-available/ 文件夹里。
- 在 server 块里添加:
location = /llms.txt {
default_type text/plain;
charset utf-8;
add_header Cache-Control "max-age=3600";
add_header Access-Control-Allow-Origin "*";
}
location = /llms-full.txt {
default_type text/plain;
charset utf-8;
add_header Cache-Control "max-age=3600";
add_header Access-Control-Allow-Origin "*";
}- 用命令 nginx -t 检查配置。应该出现检查成功的消息。
- 用命令 systemctl reload nginx 重新加载配置。
为构建器和云平台设置
在设置里找“响应头”或“Headers”版块。很多平台支持在项目根目录放一个带响应头规则的文件;语法各家不同,但意思一样:为路径 /llms.txt 设置 Content-Type 和 Cache-Control。如果没有这个功能,别担心:大多数服务器默认就把 .txt 当作 text/plain 提供,这已经可以接受。
预期结果
服务器以状态码 200 和正确的响应头提供文件。
检查: 打开命令行或终端,执行命令 curl -I https://你的域名/llms.txt。响应里应该看到 HTTP/2 200 或 HTTP/1.1 200 OK,以及 content-type: text/plain; charset=utf-8 和 cache-control: max-age=3600。想看内容的话,去掉 -I 参数。
可能遇到的问题
- 改完 .htaccess 后 500 错误。传回副本,检查有没有多余字符,并向主机商确认是否开启了 headers 模块。
- 响应头没变。服务器前面有 CDN 或代理缓存,在提供旧版本。在 CDN 面板里清缓存。
- Content-Type 还是 text/html。有规则把所有请求都重写到 index.php。确保规则排除已存在的文件,通常通过“如果文件不存在”条件实现。
结果验证:llms.txt 就绪清单
所有步骤都走完了。现在确认结果真的能用,而不只是“文件在那躺着”。逐项过清单,完成的打勾。
清单
- 在无痕模式下打开 域名/llms.txt,能看到文本。
- 文件第一行是唯一的一级标题,写项目名称。
- 标题后紧接着引用块,摘要不超过 400 字符。
- 所有链接都是绝对地址,以 https 开头,打开不重定向、不报错。
- 每个链接冒号后都有说明。
- 章节按重要性排序,次要内容放进 Optional。
- 西里尔字母显示正常,编码 UTF-8。
- 命令 curl -I 显示状态码 200 和类型 text/plain 或 text/markdown。
- 如果创建了 llms-full.txt,它能通过自己的地址打开,开头和 llms.txt 一致。
- 文件里没有个人数据和内部信息。
如何真正测试
- 检查链接。把文件里所有地址复制到任意批量链接检查器或服务器响应检查工具里。全部应该返回 200。一个坏链接不会毁掉文件,但会降低模型的信任。
- 检查有效性。把内容贴到在线 llms.txt 验证器;2026 年有好几个这样的服务,按标准名称搜。验证器会显示它是否识别出了标题、摘要和章节。
- 在真实模型上测试。打开任意能读链接的 AI 助手。给它你的文件地址,说:“研究这个文件,说说公司做什么、服务多少钱、去哪找连接说明”。如果回答准确,助手引用了正确的页面,你就成功了。如果它搞混了,看看哪些说明误导了它,然后改进。
- 从不同网络测试。如果你有不同地区的移动代理,通过它们打开文件。这能看出服务器是否对不同国家提供不同内容,或者反爬保护是否阻止了某些 IP 段访问文件。AI 智能体来自各种地址,文件必须对所有人可访问。
成功完成的标志
- 清单十项全部完成。
- AI 助手没有事实错误地转述了网站内容。
- 两到四周后,服务器日志里出现来自 AI 公司智能体对 /llms.txt 的请求。怎么找,我们在进阶板块讲。
创建 llms.txt 的常见错误及解决方法
下面是几乎每个第一次做这个文件的人都会遇到的问题。格式:问题、原因、解决。
1. 文件能打开,但 AI 工具说找不到
原因: 主机或 CDN 层面的反爬保护对所有像自动请求的访问显示验证码或 JavaScript 检查。浏览器能悄悄通过检查,智能体不行。
解决: 在保护设置里为路径 /llms.txt 和 /llms-full.txt 添加例外。用不带浏览器头的 curl 检查结果:如果 curl 拿到文本而不是带检查的 HTML 页面,就修好了。
2. 文件有了,但模型转述网站不正确
原因: 摘要含糊,或链接说明重复名称、不传递信息。
解决: 按第 2 步规则重写摘要,按第 3 步规则重写说明。再和助手测一次。
3. 文件里几百个链接,变得没用
原因: 插件自动生成,或完美主义:“什么都放上”。
解决: 回到第 1 步的审计。主要章节留不超过 50 个链接,其余移到 Optional 或删掉。完整性靠 llms-full.txt,不是靠目录长。
4. 俄文字母变成了问号
原因: 文件保存成了 Windows-1251 编码,或服务器没传 charset。
解决: 把文件重存为 UTF-8 无 BOM,并按第 6 步在 Content-Type 头里加 charset=utf-8。
5. 文件更新了,但 AI 看到的还是旧版本
原因: CDN 或工具本身缓存时间长。
解决: 把 Cache-Control 的 max-age 设为一小时以内,清 CDN 缓存。工具更新自己副本的周期不同,给它们几天时间。
6. 链接指向有重定向的页面
原因: 文件里地址末尾没加斜杠,或用了 http 而非 https,服务器会重定向。
解决: 打开每个链接,从地址栏复制最终地址。在文件里替换。智能体不总是跟随重定向。
7. 一级标题不是文件第一行
原因: 前面有带空格的空行、看不见的 BOM 字符或注释。
解决: 在代码编辑器里开启显示不可见字符,删掉第一个井号之前的所有内容,以无 BOM 保存。
8. 一个文件描述了好几个网站
原因: 想省事,用一个文件引用公司所有项目。
解决: 一个域名一个文件,只讲这个域名。其他项目可以用单独章节引用,但摘要和主要章节必须关于当前网站。
进阶玩法:llms.txt 的高级操作
基础设置完成了。这个板块写给想榨干文件价值的人:自动化更新、监控 AI 爬虫、把 llms.txt 作为推广策略的一部分。
从 CMS 或构建流程自动生成
内容经常变的网站,手动更新文件很快会烦。自动化方案:
- CMS 插件。WordPress、Joomla 等系统都有模块,能从选定的文章类型生成 llms.txt。配置成只包含需要的分类,说明从专门字段取,而不是取正文前几行。
- 构建阶段脚本。静态网站和框架,写个小脚本读取页面元数据,比如 Markdown 文件头部的 title 和 llm_description 字段,从中生成 llms.txt。部署前运行它。
- 单独的 Markdown 版页面。有些网站每个页面同时提供 HTML 和带 .md 后缀的 Markdown 地址。那 llms.txt 就可以链接到纯版本,llms-full.txt 直接拼接生成。这是对模型最方便的格式。
用命令行工具检查文件
有个官方 Python 包叫 llms-txt。它把文件转成模型上下文,同时检查结构。安装和运行:
pip install llms-txt
llms_txt2ctx https://你的域名/llms.txt如果命令输出了带章节的结构化文本,文件解析正确。如果报错,看看它卡在哪一行:通常是链接语法错了。
在日志里监控 AI 爬虫
知道文件有没有被读,最诚实的方法就是看 Web 服务器日志。步骤:
- 找到访问日志文件。Nginx 通常在 /var/log/nginx/access.log,Apache 在网站日志文件夹的 access.log。虚拟主机在面板的“统计”或“日志”版块能拿到日志。
- 过滤包含 llms.txt 的行。终端里:grep llms.txt access.log。
- 看找到的行里的 User-Agent 字段。AI 公司的智能体通常用可识别的名字,包含公司名或 Bot、Agent、User 之类的词。
- 做个简单表格:日期、智能体、文件。每月核对谁来了、来了几次。请求数增长是好迹象。
建议: 想“以智能体的眼睛”看网站,而它来自另一个国家,用目标地区的移动代理发请求:curl -x 代理地址 https://你的域名/llms.txt。这样能验证 CDN 地理设置、区域重定向和反爬保护没有阻止从国外获取文件。对面向多个国家的项目尤其重要。
落地页和联盟项目的 llms.txt
流量操盘手和小落地页主常觉得文件没用:页面就那么几个。实际上即使单页站,llms.txt 也有用:它给模型准确的 offer 表述、条件、地区和规则链接。当用户问助手关于产品的事,助手会从你的文件取事实,而不是瞎猜。做落地页矩阵的话,做个通用模板,自动替换名称、摘要和链接。
与生成式优化的结合
llms.txt 文件是 2026 年被称为生成式优化这个大方向的一部分:努力让品牌正确且频繁地出现在 AI 回答里。其他要素包括页面上的结构化数据、文章开头清晰的问题回答、作者和更新日期、所有来源中公司事实的一致性。文件把这一切串成一张地图。每次产品或价格有重大变化就更新它,模型就能拿到最新的画面。
版本管理和有效期日期
在背景段落里加一行最后更新日期,比如:“信息有效至 2026 年 3 月”。这能帮模型评估数据新鲜度。把文件和网站代码一起放在版本控制系统里,方便看修改历史。
FAQ:关于 llms.txt 的常见问题
一定要做 llms-full.txt 吗?
不用。只有 llms.txt 是必需的。但如果你有文档、说明或详细的产品描述,完整版能明显提升使用它的工具的回答质量。五个页面的落地页,一个文件就够了。
文件可以用中文写吗?
可以。用网站主要内容的语言。如果网站是双语的,在背景段落里说明第二版在哪里,如果需要,在子域名或语言文件夹里创建单独文件,从主文件引用它。章节名称也可以是中文,除了保留词 Optional。
llms.txt 多久更新一次?
每次价格变化、新章节上线、条件变更或页面删除时。如果没什么重要变化,每季度审查一次就够:检查链接、更新说明、刷新日期。
需要在网站地图里写上 llms.txt 或在哪里注册吗?
不用。工具按域名根目录的标准路径查找文件,就像 favicon。没有专门的注册。有些公开目录会收录有 llms.txt 的网站;加进去不是必须的,但也没坏处。
文件会影响普通搜索排名吗?
没有直接影响:文件不作为页面被索引,也不是排名因素。间接有帮助:它理清了结构,而在 AI 回答里的正确提及会带来品牌流量。
如果构建器不让把文件放根目录怎么办?
先找找有没有任意路径的文件上传设置或转发规则。都没有的话,给构建器客服写消息:2026 年对他们来说,要求放 llms.txt 已经不是新鲜事了。最后的选择是把文件放到单独的子域名,从“关于我们”页面引用它,虽然标准路径还是更合适。
该把博客页面放进文件吗?
放那些回答客户常见问题且长期有效的文章:教程、对比、解析。新闻和活动预告最好别放,或者放 Optional。大博客就做单独章节,放 10-20 篇最有用的。
能用一个文件覆盖公司多个域名吗?
不能。每个域名有自己的文件。项目之间可以互相引用,放在单独章节,但摘要和主要章节必须关于当前域名。
怎么知道 AI 真的在用文件?
按进阶板块的说明看日志,定期问助手关于你产品的问题。如果回答里的表述和你的摘要一致,助手也说出正确的页面,文件就在起作用。每月做一次检查表,跟踪动态。
改完服务器配置后网站打不开了怎么办?
立刻把保存的配置文件副本传回去,确认网站恢复。然后联系主机客服问开启所需模块的事。llms.txt 文件即使没有额外响应头也继续能用:服务器默认就把 .txt 当普通文本提供。
结语
总结一下做完的工作。你做了内容审计,选出了真正解释产品的页面。创建了 llms.txt 文件,有清晰的标题、诚实的摘要和结构化的链接章节。汇总了包含关键页面完整文本的扩展版 llms-full.txt。把文件上传到网站根目录,设置了服务器响应头,并用 curl、验证器和真实 AI 助手验证了结果。现在语言模型从你的网站拿到的不是混乱的 HTML 页面,而是一张带说明的清晰地图。
接下来做什么
- 设个提醒,三个月后审查文件。检查链接、更新价格和有效期日期。
- 每月看看日志,记录哪些智能体在读 llms.txt。这是关于 AI 对你项目兴趣的免费分析。
- 问几个助手关于你产品的问题,把回答和事实对比。有出入就说明该改进文件里的说明或页面本身了。
往哪发展
llms.txt 文件是 AI 可见性工作的第一步。接下来是:页面结构化数据、每篇文章开头清晰的问题回答、关键内容的 Markdown 版本、所有名录和目录里公司事实的一致性。如果你做多个地区,加上通过目标国家移动代理定期检查内容可访问性:智能体来自不同地址,文件必须对每个都可访问。内容越透明、越结构化,AI 就越准确地讲述你。这意味着更多人会带着正确的预期、做好准备找到你。