
AI 回答引擎如何选源:215,128 个批量页面的启示
新研究显示 AI 回答大量引用批量生成的"best software"页面。解析 AI 回答引擎如何选源,以及如何让真实内容可提取、可引用。
9月2日,一个研究团队就 380 个软件品类向 Perplexity 的模型询问"最佳产品",并保留了每一条回答所引用的 URL。在 7,534 条引用里,近四分之一指向连"流量前百万网站"都挤不进去的域名——其中被引用最多的三个域名,后来被证实是同一伙人批量生成的 215,128 个"best software"页面,而这些页面的服务对象不是人类读者,而是模型本身。
这个案例令人不适的地方,不在于"AI 搜索坏了",而在于它揭示了一个事实:AI 回答引擎选源的方式与搜索引擎不同。它们不对整个 web 排名,而是检索那些容易抓取、容易解析、容易引用的文档。如果你的页面真实有用但难以被机器提取,引用就会流向那些更容易被读取的网站——哪怕从没有人真正访问过它们。好消息是:对诚实的发布者来说,正确应对不是比 spam 者更能 spam,而是让真实内容变得可提取,并留下机器和读者都能核验的痕迹。
要点速览
- AI 回答引擎通过**检索(retrieval)**组装答案:抓取少数文档并引用它们。文档的选择取决于"能否被干净地抓取和解析"——2026 年 9 月的一项研究证明,这一层是可被操纵的。
- 在对 7,534 条 Perplexity 引用的研究中,三个明显同源的站点生成了 215,128 个品类页面;一家厂商的营销博客被引用的次数超过了 Gartner。
- 批量造页的路线是脆弱的:研究中的例子自相矛盾——排名互相冲突、虚构的编辑团队、未渲染的模板变量——而这些恰恰是引擎将来最容易过滤的模式。
- 对真实发布者而言,可持续的打法是:真实价值、可提取的结构、诚实的元数据,再加一次五分钟的"机器视角"自检。
先弄清三个词:接地、检索、可提取性
这个故事里,三个术语承担了大部分解释工作。
**接地(Grounding)**指 AI 系统在回答之前先抓取文档、让回答建立在这些文档之上,而不是仅凭记忆作答。当 Perplexity 或 Google 的 AI 模式回答"最适合小型机构的 CRM 是什么"时,首先有某个环节检索出候选页面,然后模型基于这些页面写答案,并附上引用。
**检索(Retrieval)**就是那个抓取环节。它的行为不太像"给整个 web 排序",更像一位快速行动的图书管理员:拿到问题后,抓走看起来相关、且机器可读的文档。Google 在官方文档中描述过类似机制——一项叫 query fan-out(查询扇出)的技术:系统围绕子主题和数据源发出多个相关搜索,然后识别出比传统结果页更多的支持链接。
**可提取性(Extractability)**指的是页面内容在这段旅程中保存得有多完整。检索系统抓到你的 HTML 后,会先把它变成文本——标题、段落、表格——然后模型才开始推理。把核心内容渲染成干净文本和结构的页面,容易被引用;把内容埋在脚本、文字图片或解析不良的布局里的页面,实际上是不可见的——内容再好也没用。
这也是 **GEO(生成式引擎优化)**与经典 SEO 分道扬镳的地方。SEO 竞争的是排名列表上的位置;GEO 竞争的是进入"答案所依赖的检索集合"——一个不同的选择层,也有不同的弱点,研究正好展示了这一点。
研究实际测量了什么
一个小型研究机构 Trellner 完成了一次迄今少见的、对这一层的认真测量。9 月 2 日,它把 380 个买家意图明确的软件品类——从"CRM software"到"博物馆藏品管理软件"——通过 OpenRouter 发给 Perplexity 的两个模型,每个品类每个模型一条提示,共 760 次调用,并保留模型报告的每一个检索 URL。最终得到跨 2,055 个域名的 7,534 条引用。

来源:Trellner Research,报告 TR-2026-009(trellner.com),2026 年 9 月。访问于 2026-09-03。
核心数字:
- 59.8% 的引用指向 Tranco 流量榜单 100,000 名之后的域名;23.4% 完全不在前百万之列。在榜内的被引域名,中位排名是第 71,611 位。
- 被引最多的域名不出意料——G2(291 次)、Reddit(261 次)——但第三名是 guideflow.com,一个卖"交互式产品演示"的厂商博客,在 380 个品类中的 96 个里被引用了 194 次。它不是评测站,与被引用的品类也不构成竞争关系。作为对比,维基百科总共被引用了 3 次。
- 前百万之外的域名还都很年轻:在被存档的被引域名中,前百万之外者首次存档的中位时间是 2020 年,而榜内者是 2011 年;前者中每六条就有一条在 2025 年之后才首次出现。
然后是给报告标题提供素材的那三家。

来源:worldmetrics.org 首页,访问于 2026-09-03。其 HTML 标题是“Worldmetrics — Facts & Grounding Page”——面向检索软件而非读者。
wifitalents.com、worldmetrics.org 和 gitnux.org 的注册时间集中在 2023 年底至 2024 年中的六个月里,共用同一对域名服务器,运行同一套页面模板。它们的站点地图各列出约 10 万个 URL——合计 215,128 个自动生成的"best <品类> software"购买指南,而每个站点的博客只有 6 篇文章。每家首页的 HTML 标题都是"<品牌> — Facts & Grounding Page",元描述几乎一字不差,都声称在"一份机器可读记录"里提供"经过验证的事实"。别忘了,grounding 是引擎的词汇,不是买家的。这些页面是在直接对读取它们的软件说话。
批量页面为何被检索到——以及破绽在哪
为什么检索层会青睐它们?机制其实很平庸。检索系统需要能抓取、能引用的文档,而这些站点正是为此而生:干净的模板、一致的结构、解析器无需解释就能读取的 JSON-LD 排名,以及巨大的覆盖面——215,128 个页面,对长尾品类查询来说就是大量彩票。报告谨慎地指出,这些页面没有任何技术意义上的欺骗;它们只是在标题和描述里对机器说话。同一项研究还发现,一家厂商的普通内容营销博客(guideflow)以同样的方式吸收了引用——这说明这个选择层奖励的是"任何人的、可发布的、可提取的规模"。
破绽藏在内容里。同样问"项目估算软件",三个姐妹站给出了三份不同的前五排名。它们的页面合计署名了九位不同的"员工"。一个页面给结果贴上"AI-verified · Expert reviewed"的标签——另一个页面的署名栏里留着没渲染的模板变量,字面上写着"Within the next 26 days"。而 worldmetrics.org 就在同样的生成 Best Lists 之上出售研究报告:定制市场研究"5,000 欧元起",现成报告"499 欧元起",选型服务"2,500 欧元起"。
有两点诚实的局限值得在此说明,说明这一次就够了。第一,这项研究测量的是"证据基础由哪些文档构成",并没有测试移除这些来源是否会改变任何答案——这些批量站点推荐的产品可能是合理的,问题在于证据层的成分。第二,Perplexity 的两个模型档位实际上共享同一个检索层(在 380 个品类中的 289 个里,引用列表逐字节相同),所以这是对同一个搜索栈的两次采样,不是覆盖全网的调查。把这项研究当作机制的一个锋利案例,而不是互联网的普查。
这个决定摆在你面前
如果你运营一个工具站、文档站,或任何真正有用的内容,这个故事其实只抛出一个决定:是用数量去追检索层,还是让你的真实页面值得被检索。
围绕"数量路线"已经形成了完整的产业——研究发布当天,“get found by AI"的咨询业务就成了 HN 上的热议话题。但研究本身就说明了为什么这是笔亏本买卖。对机器说话的内容必须伪造检索层和读者都在检查的信号——作者、编辑流程、一致的结论——而伪造是无法干净扩展的:模板变量会漏出来,结论会互相打架,还得虚构活人。引擎有很强的动机过滤这些模式;Google 针对 AI 功能的官方指引也指向另一边:不需要特殊标记、不需要 AI 文本文件、不需要秘密 schema——只要守住标准,让重要内容"以文本形式提供”,让结构化数据与页面可见内容一致。
可持续的路线几乎有点无聊:少发布,认真写,并确保机器读得懂。这不是妥协,而是护城河——因为批量制造的方式在结构上就无法通过你的真实站点能通过的那些检查。
这条路具体拒绝什么:
- 批量生成你负不起责任的品类页或对比页;
- 虚构作者、假"编辑流程"、编造的资历;
- 为爬虫而写、把读者放在第二位的页面。
给自己页面的一次五分钟体检
下面是实操部分。挑一个你真正在意的页面——工具页或指南页——检查机器抓取它时看到的是什么。
1. 用机器的方式抓一次你的页面。 把 URL 粘进 URL to Markdown,看返回的结果。这就是检索系统所能依赖的文本的大致形态。你的核心内容在吗?还是只回来了导航、Cookie 横幅和半段正文?

2. 检查标题结构。 同一份 Markdown 输出就是大纲:每个 # 和 ## 都是检索系统会倚重的标题。只读这些行,从上往下。如果它们能勾勒出页面问题的连贯答案,被引用的摘录也能;如果只是一堆营销话术,引用拉出来的也会是那些话术。
3. 像机器一样读你自己的标题和元描述。 批量站点做手脚的正是这一层——“<品牌> — Facts & Grounding Page”。URL to Any 的元标签提取器能显示你的页面对外声明了自己是什么。它应该直白地说清页面是什么、为谁而写。诚实的元数据也是自我保护:当你的标题准确说出你是什么,你就不会像那些标题只写"希望成为什么"的站点。
4. 确认实质内容是文本。 表格、规格、步骤、价格——如果只以图片形式存在,或藏在脚本之后渲染,提取时就会丢失。Google 说得很直接:把重要内容做成文本。
5. 让结构化数据与可见页面一致。 如果你的 JSON-LD 声明了评分、作者或评测,可见页面必须展示同样的东西。标记与可见内容的一致性既是搜索引擎的准则,也恰好是批量站点通不过的那道测试。
想深入了解"抓取与解析"这一半——AI 代理如何协商 Markdown,以及一个快速浏览器检查——可以读我们之前的文章:AI 代理如何读取网页。
你想要的引用
研究作者在结尾说,他们测量的是证据基础,而不是这些证据产出的答案。这个谦逊的态度同样适合发布者:没有任何体检能保证引用,再多结构也替代不了值得被引用的内容。215,128 个页面的案例真正说明的是:检索层先读结构,再读实质——所以赢家会是两者兼备的发布者。让你的真实内容容易被抓取、诚实说明自己是什么、经得起机器与人的双重核验。这样的引用,谁都不需要制造。
