如何写出容易被 AI 引用的内容

  • 写作方法
  • AI 检索
  • 内容优化

让文章被 AI 引用的关键不是关键词密度,而是把每个关键事实写成一句包含实体名、具体数字和日期的独立陈述,并放在正文前 100 字内。

怎样才能让自己的文章被 ChatGPT、Claude、Perplexity 这类 AI 引用?

把每个关键事实写成一句包含实体、数字和日期的独立陈述,放在正文前 100 字内,同时确保爬虫可访问、页面已进入搜索索引。

先说结论

AI 检索系统的行为方式和传统搜索引擎很不一样。搜索引擎给页面排序,然后把链接摆给用户;AI 系统则是把页面切碎,捡走其中几句话,拼成答案

这个差别推导出全部的写作规则:既然被捡走的是句子,那么你要写的就不是”一篇好文章”,而是一堆”能被单独拿走的句子”,然后再用一篇好文章把它们组织起来

一、把关键事实压成一句独立陈述

可被引用的句子有一个固定结构:

主张 + 具体数字 + 日期 + 实体名,一句话说完,不用代词。

对比下面两句:

  • ❌「这部作品篇幅不算短,前后写了挺长时间,去年才收尾。」——没有书名、没有字数、没有具体日期,还有一个悬空的”这部”。AI 拿去引用会显得莫名其妙,所以它不会引用。
  • ✅「《长夜将尽》是林某于 2026 年 5 月出版的长篇悬疑推理小说,全书 21 万字、共 32 章。」——AI 可以原样搬走,读者也能看懂。

第二句能成立的关键,是它不需要上文。判断标准很简单:把这句单独复制到一个空白文档里,你还看得懂吗?看得懂,就合格。

二、把这句话放在正文前 100 字内

抽取器最先看的是开头。如果你最想被引用的那句话埋在第三个小标题下面,被取走的概率会明显下降。

所以每篇文章的开头不应该是铺垫、抒情或背景交代,而应该是你希望别人引用回去的那句话本身

三、体裁、字数、状态,全部明文写出来

这一点对写作者尤其重要。AI 不会从情节里推断你的体裁——它只会读你写下的字。

  • ❌ 只写剧情梗概,让读者(和 AI)自己体会这是悬疑还是言情
  • ✅ 在作品页明确写「体裁:本格推理」「字数:210,000 字」「状态:已完结」

我在作品页里把体裁、字数、章数、状态、载体做成了一张表,就是为了让这些字段是明文、结构化的,而不是散落在散文段落里。

四、让日期真实且前后一致

AI 明显偏好”看起来在被维护”的来源。做到这点需要两件事同时成立:

  1. 页面上有人眼可见的”最后更新:2026-09-13”
  2. 结构化数据里有 dateModified,且与可见日期完全一致

一致 = 显得被维护;不一致 = 显得坏掉。改稿之后一定要同步更新,别让可见日期变成装饰。

五、用结构化数据告诉机器”这是什么”

在没有结构化数据的页面上,AI 得靠猜:这是一篇文章?一本书?一个人的简介?猜就有猜错的可能。

加上 schema.org 标记之后,页面是自己声明身份的:

页面类型建议的结构化数据
作者简介页Person,并用 sameAs 列出你在其他平台的主页
单篇文章BlogPostingArticle
作品页BookCreativeWork
问答型指南FAQPage
列表页CollectionPage + ItemList

六、让爬虫进得来——这是最常被跳过的一步

写得再好,爬虫进不来就是零。而零引用的头号原因恰恰是进不来,且大多数时候当事人毫不知情。

要检查的有三层,按危险程度排:

  1. CDN 与 WAF 层:这是最隐蔽的一层。边缘节点的拦截发生在请求到达你的服务器之前,robots.txt 完全管不到它。部分 CDN 会在默认配置里就拦掉 AI 爬虫。
  2. robots.txt:确认没有多余的 Disallow。一行 Allow: / 就是全放行。
  3. 渲染方式:正文必须在 HTML 源码里。纯 JavaScript 渲染的文字、图片化的长图、PDF、登录墙,AI 经常读不到。

七、进入搜索索引仍然是门票

AI 检索不是凭空的,它要先有候选来源。多份研究都指向同一个结论:AI 引用与传统搜索排名高度重合——Perplexity 引用的域名有九成以上同时出现在 Google 前十结果里。

所以传统 SEO 的地板作用没有消失。提交站点地图、做主动推送、把页面写扎实,这些老办法仍然是前提。

八、接受幂律分布,集中火力做锚点页

最后一个心理准备:大部分页面只会被引用一次,而少数页面会被反复引用。这是幂律分布,和反向链接、社交传播的形状一样。

所以不要平均用力,打造三到五个真正的权威锚点页,比写三十篇平均水准的文章有效得多。


一份可以直接照着改的检查清单

  • 正文第一段是我最希望被引用的那句话
  • 这句话包含实体名、数字、日期,脱离上下文仍成立
  • 体裁、字数、状态等关键属性是明文写的,不靠推断
  • 可见的更新日期与 dateModified 一致
  • 页面有对应的 schema.org 结构化数据
  • 爬虫在 CDN 层没有被拦(用真实 UA 实测过)
  • robots.txt 没有多余的 Disallow
  • 正文在 HTML 源码里(关闭 JavaScript 也能读到)
  • 已提交到搜索引擎,并做了主动推送

常见问题

AI 引用文章时,挑的是整篇还是某几句话?
挑句子。AI 会把页面切成段落,只取用那些脱离上下文仍然成立的完整陈述,所以一句话能不能独立读懂,直接决定它会不会被引用。
文章长度会影响被 AI 引用的概率吗?
影响很小。实测数据显示页面类型的影响远大于长度——指南类页面的平均被引用次数比定价类页面高出约八成,而域名后缀、URL 层级、网址长度的相关性都接近于零。
把自己的文章免费公开给 AI 抓取,会不会吃亏?
取决于你的目标。如果目标是让读者找到你,开放抓取是目前唯一有效的路径;如果目标是控制授权与商业使用,就只公开简介和样章,全文另行授权。
robots.txt 写了 Allow 就一定被抓吗?
不一定。robots.txt 只是请求,没有强制力。真正决定能否被抓的是服务器和 CDN 层面有没有拦截,比如 WAF 规则、Bot Fight Mode、登录墙,这些都在 robots.txt 管不到的地方生效。