NEWS 动态

行业观察与站点更新

两类内容:一类是我们对 AI 推荐格局的观察,每条都附可核对的数据来源; 一类是本站的发布日志,按真实提交时间记录。

llms.txt 现在到底有没有用:三组数据和一个务实结论

这半年里我们被问得最多的一个问题是「llms.txt 到底要不要做」。市面上两种极端说法都在传:一种说它是 AI 时代的 robots.txt,不做就出局;另一种说它纯属自嗨,没人读。两种说法都不准确。先看三组公开数据。

数据一:采用率约一成

据 SE Ranking 对 30 万个域名的统计,在这个概念被讨论约十八个月后,llms.txt 的采用率约为 10.13%。更早的统计显示 2025 年的采用率仅 2.13%,且其中约四成是插件自动生成的空壳文件。 增长是真的,但远谈不上普及。

数据二:AI 爬虫几乎不抓这个文件

这是最关键的一组。有监测统计显示,在 62,100 次 AI 爬虫访问中,只有 84 次请求指向 llms.txt——占比约 0.1%。GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot、Google-Extended 在实际抓取中,绝大多数情况下直接爬 HTML,跳过了这个文件。

数据三:没有任何厂商作出承诺

截至 2026 年第一季度,OpenAI、Google、Anthropic、Meta、Mistral 均未公开承诺在生产系统中读取或采纳 llms.txt。它也不是 W3C 或 IETF 的标准,只是一个社区约定。

那我们为什么还是写了

我们自己的站点部署了 llms.txtllms-full.txt,理由有两个,都跟「被 AI 爬虫读取」无关。

第一,IDE 类 AI 代理确实会读。Cursor、Claude Code、GitHub Copilot、Cline、Aider 这类工具在被指向一个站点时,会常规性地去抓 /llms.txt 与 /llms-full.txt。这类工具的使用者里, 有相当一部分是技术型采购与工程师——对做技术产品的企业来说,这不是一个可以忽略的人群。

第二,也是更重要的:写这份文件的过程本身有价值。它逼着你把「我们是谁、卖什么、 参数区间多少、凭什么可信」压缩成一段无歧义、可独立成立的事实描述。这段描述写出来之后, 真正该做的事是把它同步到官网正文、About 页、外部平台简介里——那些 HTML 正文才是爬虫真正会读的地方。

务实结论:llms.txt 成本极低(半小时),写;但不要把它当主力, 更不要相信任何「写了 llms.txt 就能被 AI 推荐」的说法。具体写法见 《如何写一份 llms.txt》

数据来源

以上数据引自第三方公开研究,我们未参与其统计过程。列出链接供你自行核对—— 这也是我们对客户内容的一贯要求:每个数字都要能追溯到来源

ChatGPT 和 Perplexity 的引用来源,重合度只有约 11%

如果你只在一个地方投放内容,然后指望所有 AI 都能读到你——这个假设在数据面前站不住。

两个平台,两套来源体系

一项覆盖约 6.8 亿条引用的分析发现,被 ChatGPT 与 Perplexity 同时引用的域名占比只有约 11%。也就是说,近九成的来源只被其中一个平台采用。两者的偏好差异相当明显: ChatGPT 更倾向维基百科与成熟新闻源;Perplexity 的 .edu 域名占比(约 3.2%)与国别顶级域占比(约 4.4%) 在主流引擎中最高,且明显集中于医学、政府与学术出版机构。

社区平台占了超过一半的引用

同一批数据显示,社区类平台(Reddit、Quora 等)合计占据约 52.5% 的引用份额, 高于品牌自有域名的 47.5%。在专业类查询中,LinkedIn 是六大 AI 平台上被引用最多的单一域名。

对出海企业来说,这条数据的含义很直接:你官网写得再好,也只是在争夺不到一半的引用份额。 另外一半在专业社区里,靠的是真实的技术讨论,不是发广告。

单一来源依赖是有风险的

2025 年 10 月 Reddit 就抓取问题起诉 Perplexity 之后,Perplexity 的 Reddit 引用量下降了约 86%,空缺主要由 YouTube 补上(YouTube 目前约占 Perplexity 前十来源份额的 16.1%)。 一场诉讼就能让某个来源的权重在几个月内塌掉——这不是你能预测或控制的变量。

我们从中得出的三条做法

  • 至少覆盖三类性质不同的来源:自有域名、行业专业平台、真实社区讨论。不要押注单一渠道。
  • 用实测决定投哪里,而不是看权重榜单。拿你品类的典型问题去问 ChatGPT 和 Perplexity, 看它们实际引用了谁——那才是有效清单。
  • 保证跨来源的口径一致。同一参数在三个地方是三个数,等于三个地方都不可用—— AI 恰恰是靠交叉验证来决定敢不敢引用的。

另一个值得注意的数字:即使是任一平台上被引用最多的域名,通常也不超过总引用量的 5%。 引用是高度分散的,这对新进入者其实是好消息——不存在一个赢家通吃的位置。 具体的平台筛选方法见 《如何选择值得投放的行业技术平台》

数据来源

以上数据引自第三方公开研究,我们未参与其统计过程。列出链接供你自行核对—— 这也是我们对客户内容的一贯要求:每个数字都要能追溯到来源

CHANGELOG 发布日志

本站更新记录

我们把自己的官网当作交付能力的样板间,所以更新过程也公开。

  1. 操作指南补齐至 10 篇

    新增 llms.txt 写法、大牌型号对标库、内容可引用性自检、FAQ 结构设计、提及率监测、平台选择、英文技术长文七篇完整分步指南,全部加载 HowTo 结构化数据。

  2. 上线自查工具、资料下载与质量控制页

    18 项交互式 GEO 自查(实时打分)、《AI 能见度诊断报告》在线样例、交付质量控制规范与四条合同红线;部署 llms-full.txt 完整事实档案。

  3. 官网加入开场动画与服务市场区块

    两幕式品牌开场动画;客户实证页新增欧洲/北美/东南亚·中东/南美四大市场覆盖与提问习惯差异。

  4. 定位从单一品类扩展为全行业覆盖

    行业方案扩至九类,全站文案与结构化数据去除单一品类倾向,覆盖化工新材料、机械装备、电子元器件、饲料生物、消费品等。

  5. 正式域名 ileadengine.com 启用

    canonical、sitemap、robots.txt、llms.txt 与全部 JSON-LD 同步切换至正式域名。

  6. 资源中心上线

    技术问答 15 篇(FAQPage 结构化数据)、操作指南首批 3 篇(HowTo 结构化数据)、行业方案九类与选型表。

  7. 立德引擎官网正式上线

    多页静态站,同步部署 JSON-LD 结构化数据、robots.txt AI 爬虫放行、llms.txt 与 sitemap。

这些数据换算到你的品类,是什么结论?

我们用海外买家的真实提问语言,在四大模型中实测你的品牌与主要竞对,看 AI 究竟引用了谁的什么内容。3 个工作日交付。