博客
GEO

llms.txt 映射文件真的有效吗?

在一个大型语言模型正成为信息检索主要工具的世界中,控制 AI 如何阅读和引用你的网站变得具有战略意义。llms.txt 文件由 Answer.ai 的 Jeremy Howard 在 2024 年提出,旨在解决如何构建内容以供 AI 系统阅读的问题。

使用以下标签编写 llms.txt,列出最重要的功能

起源

大型语言模型面临一个关键的架构限制:它们的上下文窗口太小,无法处理整个网站。将包含导航、广告、JavaScript 和 CSS 的复杂网站转换为 LLM 友好的干净文本既困难又不精确。

Jeremy Howard, Fast.ai 联合创始人和昆士兰大学与斯坦福大学的讲师观察到,大多数网站上的 HTML 都由菜单、跟踪脚本、重复部分和广告组成——这些元素在 LLM 上下文窗口中消耗了宝贵的 token,却并未提供实质性价值。受 robots.txt 简洁性的启发,Howard 创建了一种标准,允许网站所有者在单一、可访问的位置为 LLM 提供结构化、专家级的知识。

技术规范

llms.txt 标准定义了一种精确的基于 Markdown 的结构,它结合了人类可读性和程序化解析能力。该文件必须位于  /llms.txt  网站的根路径中,并按特定顺序包含以下部分:

必需组件:

  • H1 标题 - 项目或网站的名称(唯一强制性部分)

可选但推荐项目:

  • 引用块 - 包含项目关键信息的简洁摘要,用于理解文件其余部分
  • 描述性部分 - 零个或多个不带标题的 Markdown 段落(段落、列表),包含关于项目的详细信息以及如何解释所提供的文件
  • H2 标题下的文件列表部分 - 零个或多个由 H2 标题分隔的部分,包含带有附加详细信息的 URL 列表
  • 可选" 部分 - 具有特殊含义的章节。其中包含的 URL 在需要较短上下文时可以省略

链接规范:

每个文件列表必须包含所需的超链接 Markdown 名称(url) ,后跟可选的  :  和文件备注。

.md 扩展名


该提案还意味着包含对 LLM 有用的资讯的网站应在相同 URL 下提供一个干净的 Markdown 版本,并添加  .md  (或  index.html.md  用于没有文件名的 URL)。

实施示例

以下是可供自定义和实施的专业 llms.txt 模板:

# [Your Company or Project Name]
> A concise description of your business, one or two sentences explaining the specialization, offering, or purpose of the project. This section helps LLMs understand the context of the remaining resources.
Key contextual information:
- First important note about the nature of the business or technology
- Second note specifying scope or limitations
- Third note clarifying the target audience
## Main Resources
- [Home Page](https://example.com): Introduction and latest announcements
- [API Documentation](https://example.com/api): Complete technical documentation with examples
- [Quick Start Guide](https://example.com/quickstart): Step by step onboarding for new users
- [Best Practices](https://example.com/best-practices): Proven patterns and recommendations
## FAQ and Support
- [Frequently Asked Questions](https://example.com/faq): Answers to the most common user questions
- [Troubleshooting](https://example.com/troubleshooting): Diagnostic guide for common issues
- [Contact](https://example.com/contact): Contact form and company details
## Developer Resources
- [API Reference](https://example.com/api-reference): Full endpoint documentation
- [Code Examples](https://example.com/code-examples): Practical implementations and case studies
- [Changelog](https://example.com/changelog): History of changes and updates
## Optional
- [Company History](https://example.com/history): Project evolution and milestones
- [Blog Archive](https://example.com/blog-archive): Older blog posts
- [Privacy Policy](https://example.com/privacy): Detailed information on data protection

综合指南可在以下位置找到: https://llmstxt.org

重要指南:

  • 文件大小应限制在约 100 KB 以获得最佳性能
  • 编码:UTF-8
  • 格式:纯 Markdown,不含 HTML
  • 所有 URL 都应采用绝对地址(例如 https://example.com/url),而非相对地址
  • 链接必须指向活跃资源(避免404错误)

可选的llms-full.txt

该标准还提供了一个可选文件  llms-full.txt ,其中包含完整的、开发好的文档在一个文件中。虽然  llms.txt  充当目录,  llms-full.txt  提供所有链接文档的完整内容,使AI系统能够通过单个请求访问整个知识库。 \
\
有关llms.txt和llms-full.txt的灵感和地图列表,请访问: https://llmstxt.site

验证和测试

检查:

  • 位置和可达性(HTTP 200,无重定向循环)
  • HTTP头(Content-Type: text/plain或text/markdown;charset UTF-8)
  • 内容长度和GZIP/Brotli压缩
  • 内容新鲜度和规范URL
  • 许可和AI关系属性,或AI模型如何使用您的内容
  • Markdown语法、结构(H1、H2、链接正确性)的正确性,例如,在页面上: https://markdownlivepreview.com

手动可访问性测试:

curl -I https://yourwebsite.com/llms.txt
# Check: HTTP/1.1 200 OK
# Content-Type: text/plain; charset=utf-8
# Content-Length: [size]
curl https://yourwebsite.com/llms.txt
# Verify content and formatting

使用LLM的测试

  • 向ChatGPT、Claude、Gemini模型提供llms.txt的URL
  • 询问关于您网站的关键信息
  • 验证AI是否正确使用了指示的资源和链接

GA4中的日志监控和流量分析:

注意来自用户代理的流量:

  • GPTBot(OpenAI)
  • Claude-Web(Anthropic)
  • GoogleOther(Google AI)
  • PerplexityBot(Perplexity)
  • 其他AI机器人

llms.txt实施后这些机器人访问量的增加是有效性的指标。研究 Insightland 展示 GPTBot访问量增长600% 在llms.txt实施后。

最常见的10个错误

错误1:文件位置不正确

问题: 文件被放置在子目录中,而不是根目录
解决方案:始终将文件精确放置在  https://yourwebsite.com/llms.txt 下,而不是在  /seo/llms.txt  中  /ai/llms.txt .

错误2:缺少所需的H1标题

问题: 文件开头缺少 1 级标题

解决方案: 第一行必须包含  # Project Name.

错误 3:编码不正确

问题: 以非 UTF-8 编码保存的文件。

解决方案: 使用明确的 UTF-8 编码保存文件。在大多数编辑器中:文件 → 另存为编码 → UTF-8。

错误 4:超出大小限制

问题: 文件大于 100 KB

解决方案: 将内容限制为最重要的资源。使用 llms-full.txt 获取完整文档。

错误 5:Markdown 链接语法不正确

问题:  标题 (https://url)  而不是标题(https://url)  (括号前有空格)

解决方案: 确保没有空格在  ]  a  ( .

错误 6:缺少带描述的引用块

问题: 省略了项目的情境描述。

解决方案: 添加  > Short description  在 H1 标题后进行修正以提高 LLM 的理解能力。

错误 7:死链和 404 错误

问题: 链接到不存在的资源。

解决方案: 定期使用诸如死链检查器等工具测试所有 URL。

错误 8:无关内容过多

问题: 所有子页面的列表,没有优先级排序。

解决方案: 选择 5-15 个最重要的资源。质量 > 数量。

错误 9:未使用“可选”部分

问题: 所有资源处于同等重要性水平

解决方案: 将次要资源放置在该部分中  ## Optional 以便在上下文有限的情况下可以忽略它们。

错误 10:无部署后验证和更新

问题: 假设文件无需测试即可工作,且无内容更新。
解决方案: 每次更改后进行验证和可访问性测试。将更新信息添加到地图中 -> Last update

它是否有效?

根据数据 BuiltWith october 2025, 844,473个网站 已实施llms.txt标准。SE Ranking对300,000个域名的分析显示采用率为 10.13%,其中大部分部署来自开发者工具领域、技术文档平台和技术公司,这些公司中AI编码助手对业务至关重要。

llms.txt标准已被领先科技公司采用,包括Anthropic(Claude文档)、Cloudflare、Stripe、Perplexity、Cursor、Solana、ElevenLabs、Hugging Face、Raycast、Yoast、DataForSEO、Zapier和Mintlify。

案例研究 1: Insightland

结果:

  • GPTBot访问量增长了 600% (从几百次增加到近2,000次访问)
  • Perplexity-User出现 3天内出现了7次
  • TikTok、Moz、Amazon、Petalbot、Bytedance和Bing机器人访问了llms.txt文件
  • 整体网站流量增长
  • 对传统SEO排名无负面影响

案例研究2: WordLift

结果:

  • 有机流量增长 ~25% 在实施llms.txt后
  • AI更好的索引,知识面板和摘要中更丰富的可见度

案例研究3: Mintlify

结果:

  • LLM处理文档的时间减少 40%
  • 通过提高AI响应的准确性 30%
  • 数千个技术文档网站自动获得了llms.txt文件

案例研究4: Cloudsential

结果:

  • 在AI中的可见度显著增加
  • Cloudsential成为ChatGPT SEO相关查询的顶级来源

GEO有效性的证据

生成式引擎优化(GEO)研究 由研究团队进行的一项研究表明,使用内容优化策略来优化生成式引擎可以将来源可见度提高 高达40% 在AI生成的响应中。

最有效的GEO方法:

  • 添加引用 - 可见度增加超过40%
  • 添加统计数据 - 可见度增加超过30%
  • 优化内容流畅性 - 显著提升
  • 引用来源 - 显著改善
  • 技术术语 - 中等改善

该研究对基准进行了系统评估 GEO-BENCH 包括来自多个领域的10,000个多样化查询。

与GEO/AEO生态系统集成

llms.txt标准是更广泛的生成式引擎优化(GEO)和答案引擎优化(AEO)策略的基本组成部分。以下是全面、整体方法的要点:

1. SEO不再是“必备”,而是押注GEO/AEO

传统SEO仍然至关重要,但仅靠它并不能保证在LLM模型中的可见度。越来越多的分析表明,即使拥有完善的SEO的品牌也不总是出现在模型的响应中。与此同时,也有品牌几乎未进行SEO努力,却仍被LLM引用的例子,这表明AI中的可见度取决于除传统搜索引擎权威之外的其他因素。

关于大型语言模型响应中品牌可见性的现有研究表明,即使全球品牌在传统SEO中排名良好,也可能保持不可见。我们在Google和LLM中的可见性测试显示,一些品牌在Google的关键类别短语结果中几乎不出现,而LLM模型却继续引用它们。这表明这些品牌并未持续进行SEO努力,限制了其在搜索引擎中的可见度,但对其在LLM响应中的存在影响较小。
Tomasz Cincio - Semly.ai 首席执行官(CEO)

2. 结构化数据(Schema.org)

为 FAQ, Article, Product 和其他类型的内容实现Schema标记可提高被引用的可能性。包含完整结构化数据的页面更有可能被AI引用

3. AI友好的内容架构

  • 前置信息: 在内容开头提供关键信息
  • 层次结构: 清晰的H1-H6标题
  • 字母和项目符号: 通过AI提高可提取性——即语言模型提取、回忆或重现数据的能力
  • 短段落每句少于25个词,每段少于100个词

查看AI模型如何看待您的网站,而非通过https://semly.ai输入您的网址: https://r.jina.ai/https://semly.ai

4. 权威与内容

  • 外部引用权威第三方的提及
  • 域名权威: 整体行业可见度
  • 内容新鲜度: 过去12个月内更新的页面被引用的可能性是2倍

5. 品牌可见度评分指标

设计: (提及您品牌的回应数÷回应总数)×100

支持性指标:

  • 引用率: LLM回应中提及或链接到您品牌的百分比
  • 情感评分: (正面 + 0.5 × 中性提及)÷ 所有提及
  • 话语权占比: 总引用中与竞争对手相比的百分比

AI可见度监控工具

AI可见度监控工具市场正在快速增长,企业希望了解ChatGPT、Gemini、Perplexity或其他模型如何呈现其品牌或产品。以下概述对比了Semly、Profound和Searchable。与竞争对手不同,Semly不仅衡量AI中的可见度,而且是此比较中唯一 主动创建正确的商品数据 在LLM和数据聚合器中,这实际上增加了品牌出现在AI推荐中的机会。

标准 Semly(semly.ai) Profound(tryprofound.com) Searchable(searchable.com)
该工具的总体目的 为电商、服务和品牌提供GEO(生成式引擎优化)——提高可见度 在LLM响应中,并通过AI搜索开启新的销售渠道。 企业AI可见度:监控品牌在 响应生成引擎和答案引擎中的出现情况,为大型团队提供报告。 AI搜索的高级工具包:可见度分析、内容、审计 技术性和AEO(答案引擎优化),结合来自GA4和GSC的数据。
与LLM和数据的关系 主动创建并标准化LLM下的数据: 为商店构建结构化产品信息流,这些商店已为数据聚合器准备就绪 供LLM使用(ChatGPT、Gemini和其他工具)。Semly不仅衡量可见度, (ChatGPT、Gemini 和其他工具)。Semly 不仅衡量可见度, 提供模型本应读取的原始数据 主要功能包括:. 监控和 可见度 分析 :Profound Analytics,品牌现有内容被AI引用的情况、它们的数据来源以及声音份额的变化。Semly不创建新的产品信息流 供LLM使用,仅处理现有数据。 以及声音份额如何变化。不会创建新的产品供应 在LLM下,仅适用于现有数据。 监控和 追踪与 分析 优化:可搜索的链接数据 关于AI中的可见度,包括流量分析、审计内容和页面内优化。 它不作为LLM的饲料管理器,而是作为分析和优化工具。
专注电子商务 是的,以电子商务为先:专为网店、服务、 希望通过AI销售的品牌和制造商设计的产品。 相反,这是一个跨行业的品牌企业工具 (SaaS、零售、金融等)。 横向AEO工具包:支持电子商务,但并非专用于网店,面向广泛的营销-SEO市场。 面向网店,针对广泛的营销-SEO市场。
可见度与销售:检查网店的产品和服务是否可以被LLM推荐,以及如何改进数据以提高在购买响应中出现的机会。 答案引擎洞察:追踪品牌引用、AI找到信息的来源,以及在选定提示的AI搜索结果中的分享。 由LLM推荐以及如何改进数据以提高成功率 出现在购买响应中。 数据输入 产品饲料(例如Google Shopping XML)和品牌的数据抓取。Semly将数据映射并处理成一种形式, 仪表板 AI 搜索:在 ChatGPT、Claude、Perplexity 等平台中的可见度... 结合来自GA4和GSC的流量分析、AEO以及页面SEO审计。
产品饲料(例如Google Shopping XML)和品牌的数据抓取。Semly将数据映射并处理成一种形式, 产品数据源(例如 Google Shopping XML)和品牌数据抓取。Semly 将数据映射并处理成一种形式, 哪些数据聚合器和LLMs可以有效使用。 提示集、关键词、域名、市场和竞争对手。 输入主要是向AI和服务地址查询的内容。 域名、关键词、活动、与GA4、GSC和CMS的集成 (例如,Webflow、Shopify、WordPress)以将可见度与流量结合。
支持的AI引擎(高级别) ChatGPT、Gemini和其他流行的LLM和AI界面用于搜索服务和产品(AI购物、推荐)。 ChatGPT、Perplexity、Google AI摘要/ AI模式、Grok、Meta AI ChatGPT、Perplexity、Google AI 概览 / AI 模式、Grok、Meta AI ChatGPT、Claude、Perplexity、Google AI、Copilot和经典 ChatGPT、Claude、Perplexity、Google AI、Copilot 和经典 入门价格
入门价格 从约24欧元每月 (品牌使用的简单订阅服务)。 企业定制定价 :网站上无具体费率,商业联系后定价。外部评论显示典型的计划约为 网站上的定价信息,商业联系后提供。外部评论 表明典型计划的 约399美元每月 向上,起始计划仅限约99美元每月。 (未标明具体费率的)付费计划 : 从7天免费Pro试用期开始,后续价格 仅在点击“查看所有计划”后才可见 联系销售部门。定位为营销团队的解决方案 高级类型
成本水平与 Semly 对比 品牌入门级:成本相当于一个简单的 SaaS 订阅或每月一次看电影的费用。 显著更高:通常 Semly 成本的数倍 按规模计算 每月,专为企业的预算设计(营销、公关、SEO)。 介于 Semly 和 Profound 之间,更接近工具模块 面向营销和分析服务的高级产品,旨在服务于 团队和机构,而非单个品牌。
最佳使用场景 一个网店或品牌希望其产品或服务能够 现实地被 ChatGPT、Gemini 和其他 LLM 推荐,并且 数据由数据聚合器正确共享。 一个全球企业品牌希望衡量 AI 如何代表其品牌形象, AI 从何处获取数据,AI 中的品牌声量和声誉如何。 营销团队或机构希望将 AI 搜索中的可见度 与流量分析、内容审计和内容创作流程整合到一个工具中。 两者都适用
查看 AI 是否能看到您的品牌

进行免费审核

Profound Profound,以及 可搜索的 是高级分析工具,但它们专注于监控品牌形象和声誉。 Semly 工作方式不同:它将可见度监控与在LLM下创建数据的功能结合起来,因此它会影响模型可以看到和使用的内容。同时,Semly的入门成本远低于国外企业平台。因此,Semly成为第一个真正为电商和品牌设计的GEO工具,不仅报告,而且积极提高在新AI渠道中的销售机会。

标准的未来

虽然llms.txt标准仍是实验性的,但它正朝着更广泛的采用发展。Google已将其纳入其Agent to Agent(A2A)协议中,至少表明了实验性兴趣。Mintlify在2024年11月启用了llms.txt的自动生成功能,为它们托管的每个文档站点都即时添加了数千份技术文档到生态系统中。

Jeremy Howard 在2025年3月表示,这一愿景超越了当前的现实——一个以AI为先的网络标准,在这个标准中,语言模型不再浪费token在冗余的HTML上,而是可以专注于相关的知识。

总结

llms.txt文件代表了向AI系统提供网络内容方式的根本性改变。虽然该标准仍是实验性的,但已实现大规模采用(超过844,000个网站),并产生了可衡量的结果——AI响应中的可见度提高20%至40%,AI机器人访问量增加600%,响应准确性提高30%。

关键发现:

实施简单,但需要精确性: Markdown结构、UTF-8编码、根目录中的位置和正确的部分层次结构是有效性的关键。

验证是强制性的:例如,使用ChatGPT来验证地图在发布前是否正确。

避免最常见的10个错误:放置不当、缺少H1、编码错误、超出大小限制、链接语法错误、缺少blockquote、死链、内容过多、忽略可选部分和缺乏测试。

与GEO/AEO集成: llms.txt是包括SEO、结构化数据、AI友好内容架构和品牌形象建设在内的更广泛策略的一部分。

监控有效性: 使用Semly.ai等工具跟踪品牌形象分数、引用率和话语份额。

定期更新: 内容的新鲜度至关重要——在过去12个月内更新的页面被引用的可能性高出2倍。

在一个AI正演变为主导信息发现界面的时代,控制语言模型如何解释和展示你的品牌形象成为一项战略必要。llms.txt标准得到了实证支持和日益增长的采用,代表了迈向以AI为先的网络的根本性一步。

常见问题解答

llms.txt 是官方标准吗?
不,llms.txt 是由 Jeremy Howard 创建的建议标准。没有主要的 LLM 提供商正式确认会读取这些文件,但实证证据(AI 机器人访问量的增加、案例研究)表明该标准实际上正在被使用中。

llms.txt 的实施是否保证 AI 引用?
不,llms.txt 并不能保证引用。然而,它确实通过使 AI 更容易访问关键内容来提高引用的可能性和相关性。研究表明,实施后可见度提高了 20-40%。

llms.txt 是否取代 robots.txt 或 sitemap.xml?
不。这些文件各有不同的用途:

  • robots.txt - 控制索引机器人的访问权限
  • sitemap.xml - 搜索引擎所有可索引页面的列表
  • llms.txt - 为 AI 定制的关键资源地图

我应该多久更新一次 llms.txt?
至少每季度更新一次,或在网站结构发生任何重大变化、添加关键内容或重新品牌化之后。超过12个月未更新的内容被AI引用的可能性低2倍。

我可以在网站的不同部分使用多个 llms.txt 文件吗?
是的,该规范允许在子路径中存在文件,例如:  https://docs.example.com/llms.txt  用于文档部分。请始终将主文件保留在域名根目录中。

llms.txt 文件的最佳大小是多少?
建议限制在约100 KB。较大的文件可能会使LLM上下文窗口过载。对于大量文档,可使用 llms-full.txt 作为补充。

llms.txt 是否影响传统SEO?
研究表明,对SEO排名没有负面影响。该文件对传统搜索引擎是中性的,并且可以通过提高AI中的品牌可见度间接支持SEO,从而为网站带来流量。

如何衡量 llms.txt 的效果?
监控:

  • GA4中的日志和机器人流量(AI机器人访问量的增加)
  • 像Semly.ai这样的工具将向您展示您的品牌在AI中的可见度
  • 品牌可见度评分和话语权份额
  • Google Analytics中来自AI搜索引擎的流量

小型企业是否应该实施llms.txt?
是的,如果您关心在AI生态系统中的可见度。实施很简单(1-4小时),成本低廉,并且可以带来显著的好处,风险很小。

如果我没有资源为所有网站创建.md版本怎么办?
专注于最重要的5-10个资源。质量和优先级比完整性更重要。您可以直接链接到HTML,尽管更喜欢Markdown。

术语表

LLM(大型语言模型) - 一个大型AI语言模型,能够从大量训练数据集中理解和生成文本

Markdown - 一种轻量级的标记语言,用于格式化文本,以简单和可读性为特点

上下文窗口 - LLM在单个查询中能处理的标记(文本单元)的限制

GEO(生成式引擎优化) - 优化内容以提高出现在AI生成回复中的几率的过程

AEO(答案引擎优化) - GEO同义词;针对AI响应引擎的优化

解析 - 计算机程序分析数据结构的过程

User-Agent - HTTP头部中的机器人或浏览器ID

Schema.org - 网站的常见结构化数据字典

品牌可见度得分 - 衡量品牌在AI响应中提及频率的指标

来源

llmstxt.org - 标准的官方规范

answer.AI (Jeremy Howard) - 标准提案与论证

llmstxt.site - 已经实施llms.txt或full-llms.txt地图的网站索引

r.jina.ai/https://semly.ai - 检查AI机器人如何看待您的网站

研究:GEO - 学术研究(可见度提升40%)

Aggarwal P. 等人,《GEO:生成式引擎优化》,KDD '24,2024 - 在AI生成式系统下优化内容可见性的新颖研究与框架

查看 AI 是否能看到您的品牌

进行免费审核

分享:

阅读有关人工智能的其他文章

检查 ChatGPT 是否看到您的品牌

几分钟内获取您的第一个 AI 可见性报告。