Executive Summary

研究边界:本研究聚焦生成式搜索与AI引用机制。研究问题:为什么有些内容能被传统搜索引擎找到,却在ChatGPT Search、Perplexity、Gemini或Google AI Overviews生成的答案中处于“事实上的不可见”?

发现1|AI系统处理网页的方式是“抽取”,不是“通读”。 解释:大语言模型在生成答案前,通常从已检索的网页或知识片段中截取与问题高度匹配的短内容。行业观察指出,如果一个产品页只包含标题、价格和图片,缺少可回答问题的结构化说明,这个页面在LLM的视角中可能接近不存在。此判断属于行业观察,结论与RAG检索机制相符。

发现2|传统搜索中的“被检索到”,越来越不等于AI答案中的“被引用”。 解释:传统搜索以网页为粒度,以链接关系为权重;生成式搜索以信息片段为粒度,以是否参与答案为价值。即便某个网页在传统搜索结果中可见,也不一定被AI系统选入生成上下文。

发现3|Citation Readiness(引用就绪度)正在成为新的可见性条件。 解释:AI选择来源时,会综合考虑内容的可抽取性、来源信誉、信息完整性、实体一致性和外部验证。缺乏这些条件的页面即使被爬取,也可能在生成环节被过滤。

发现4|“被搜索但不被理解”是一种独立的AI可见性缺口。 解释:实体识别要求系统知道页面描述的是哪个品牌、产品、人物或机构。当页面没有清晰的实体锚点和属性结构时,AI无法将该页面与其他信息连接。

发现5|AI搜索改变的不是信息数量,而是信息选择机制。 解释:信息没有被消灭,而是越来越多地经过AI的抽取、验证和重新表述后,再呈现在用户面前。这个过程的透明度仍不完整,但它已成为信息基础设施的一部分。

Research Background

传统搜索的信息发现机制建立在“查询—网页列表—用户点击”路径上。网页排序决定信息入口,用户点开内容后自行判断相关性。在这一体系里,“搜索结果中的位置”几乎等同于“可见性”。

生成式搜索打破了这一路径。系统不再只返回链接,而是在检索多个来源之后,生成一段带引用的内容。Google推出AI Overviews与AI模式,ChatGPT与Perplexity将搜索结果和自然语言答案结合,Gemini与Copilot也通过检索增强生成接入实时信息。这些入口的表达方式虽有不同,但都共享同一类信息处理机制:先寻找候选段落,再把候选片段转化成答案。

因此,搜索系统对网页的阅读方式开始发生变化。人类读者可以从无结构的营销语言中建立印象,而AI系统更倾向于从短小、断言式、结构清晰的信息中“抽取”可用的回答材料。生成式搜索将网页从“需要访问的目的地”变成“候选答案的来源”。

Current AI Search Landscape

当前AI搜索生态有两个显著特征。

第一,入口多元化。用户可以在传统搜索框、聊天界面、浏览器助手、社交媒体搜索甚至企业应用中提出同样问题,不同入口背后的模型和检索策略不完全相同,但它们都可能在返回答案时引用一个共同的外部网页。

第二,系统趋同化。无论是ChatGPT Search的浏览能力,Google AI Overviews的“AI概述+来源链接”,Perplexity的“先搜索后回答”,还是Copilot的“联网+答案生成”,技术基础设施基本围绕检索增强生成展开。它们都要经过Crawler(爬取)、Index(索引)、Embedding(向量化)、Retrieval(召回)、Ranking(排序)、Generation(生成)、Citation(引用标注)这一条处理链。

这条处理链,就是生成式搜索时代的信息可见性基础设施。品牌、媒体、机构如果想理解自身是否存在于AI答案中,需要理解这条链上哪一步会阻挡自己。

Key Research Findings

KF1:引用层与排序层脱钩

现象:一些内容在传统搜索结果中出现在较前位置,但在AI答案中很少被引用;另一些内容不在搜索结果高位,却因为概括性强、实体清晰、被权威媒体独立提及,而成为AI答案的引用来源。

机制:传统搜索评估的是网页与关键词的相关性;AI生成系统需要的是“可以直接嵌入答案文本的片段”。两者的评估粒度不同。

影响:信息可见性应从“网页级排序”转向“答案片段级引用”。一个页面能否进入答案,取决于它能否成为某个具体问题的可引用材料。

KF2:可被抽取的内容才有资格进入答案

现象:只有标题、价格、照片的产品页,对用户而言是正常页面,但对AI系统来说,缺少可供提取来说明产品属性、用途、差异的文本。

机制:RAG阶段,文档被切分嵌入。若一个页面没有明确的任务描述、定义、特征列表或结论句,系统很难在其他来源之间建立关联。即使被召回到上下文,也无法承担答案中的论据角色。

影响:内容的“机器可读性”不只是代码层的结构化,还取决于语言层是否存在可抽取出、可验证的命题。

KF3:实体一致性影响AI对该组织的理解

现象:一个品牌在不同平台混用名称、联系方式、产品分类和公司描述,AI系统可能在实体识别阶段形成碎片化或错误理解。

机制:实体识别通过上下文确认“谁是什么”。当一家机构的传播内容缺乏一致的身份锚点,同一实体的信息会被分散处理,削弱引用可信度。

影响:企业传播需要从“面向受众的叙事一致性”升级到“面向机器理解的实体一致性”。这不是文案问题,而是信息架构问题。

KF4:引用可信度来自来源自身的可验证性

现象:AI在生成医疗、金融或组织类信息时,倾向于引用能被多个独立来源验证的页面。

机制:来源选择部分基于检索排序,部分来自验证环节。外部提及、公开资料、结构化元数据和时间戳,都会参与“是否引用该来源”的决策。

影响:权威性不再由网站自身的自我描述决定,而是由其他信息源、监管记录和独立机构所构成的引用网络决定。

KF5:AI搜索可见性要求从“页面资产”走向“知识资产”

现象:组织拥有许多页面,但只有少量内容会成为AI世界的知识节点。

机制:生成式搜索是在压缩信息。被引用的内容经常是定义、规格、比较、结论或可以被概括的边界条件。营销性的长篇幅、低信息密度的文本,不易被提取成答案。

影响:组织需要在传播系统中区分“体验型内容”与“知识型内容”。后者更容易参与AI答案生成。

Technical & System Analysis

AI的信息处理可以概括为一个七环节模型:

Crawler(爬取)→ Index(索引)→ Embedding(向量化)→ Retrieval(召回)→ Ranking(排序)→ Generation(生成)→ Citation(引用)

在这一模型中,传统“页面质量”只是起点。Crawler决定是否能读取内容;Index决定是否有稳定的位置;Embedding将文本转换为可比较的向量表达;Retrieval决定在某个问题上哪些候选内容被抽出;Ranking决定候选之间的优先级;Generation将多个片段组合成答案;Citation决定最终呈现的用户入口。

需要区分的是:Embedding处理的是“语义相似”,不处理“事实正确”。内容是否可靠,需要在下游由大语言模型通过来源约束和交叉验证来处理。这就是为什么AI引用机制如此重要:引用不只是礼貌性标注,它是生成系统对外部世界负责的一种方式。当一个来源被加入引用,系统等于把该内容纳入自己的“可负责片段”集合。

概念定义:Answer Extractability(答案可抽取性)

答案可抽取性指一个网页中的信息是否允许AI系统将某一特定段落从原语境中独立取出,直接用于回答用户问题。与传统搜索中的“关键词相关性”相比,可抽取性更关注内容的命题结构、实体边界、上下文自含性和可验证性。

在此基础上,我们提出AI可见性形成模型(AI Visibility Formation Model):

信息创作(Information Creation)→ 机器理解(Machine Understanding)→ 来源验证(Source Validation)→ AI召回(AI Retrieval)→ 答案引用(Answer Citation)→ 品牌认知(Brand Recognition)

这个模型试图解释:为什么一个品牌被搜索到,但仍然不在AI答案中。其背后是信息从“人类可读内容”进入“机器可决策知识”的过程。品牌只有在每个环节都被正确表达,最终才会作为一个稳定实体被AI引用。

一个重要行业观察来自High Voltage SEO:LLM不会像人一样阅读网站,它们会“抽取”。如果产品页只有标题、价格和照片,没有上下文、结构或可回答的内容,那么对ChatGPT、Perplexity和Google AI Overviews而言,该页面可能相当于不存在。这个观察在生产级AI检索系统中具有一定解释力,可为后续研究提供微观切口。

Organizational Impact

生成式搜索的影响已超出搜索部门,需要被理解为组织知识可见性问题。

品牌团队:需要判断品牌是否作为一个统一实体被AI认识。若媒体与官网描述不一致,品牌在知识层会被分裂。

传播团队:应关注内容是否能在不经过品牌自我宣传的情况下,被第三方和AI系统识别。引用信用来自他者,不来自自述。

媒体关系:外部报道、结构化新闻数据、行业资料库正在成为AI引用的上游。发言人背景、组织沿革、核心数据的一致性,会影响专业报道是否成为可验证引用。

政府与行业组织:公开目录、政策文件和标准化信息越规范,越容易成为AI生成公共服务答案时的默认引用来源。这既是可见性机会,也是公共信息责任。

这些影响无法被某一个部门独立解决。生成式搜索将传播、技术、知识管理和信息来源验证揉进同一条处理链,要求组织重新分工。

Future Research Signals

未来值得观察的不是“哪个AI会赢”,而是以下信号:

  1. AI引用稳定性:同一问题在不同模型、不同时间、不同对话上下文中的引用是否一致。引用稳定,代表该系统形成知识标准;引用不稳定,则存在系统偏差。

  2. 搜索入口变化:当用户从“搜索链接”迁移到“直接提问”,组织如何衡量自身在答案中的存在,会成为新的度量问题。

  3. 实体形成过程:AI如何把分散的品牌信息整合成一个稳定实体。实体是否被建立、被更新、被验证,将影响后续所有相关内容的引用概率。

  4. 知识生态结构:数据库、政府目录、行业标准、学术出版、专业媒体和官网内容之间的话语权重如何形成,将决定下一轮权威定义。

  5. 结构化信息的反馈机制:当机器可读信息增加时,公开网络会出现怎样的信息趋同或新的博弈形态。这会改变AI答案的知识生态。

Veerixa Research Perspective

AI搜索时代的核心变化,并不是信息减少,而是信息选择机制发生变化。网页依然存在,流量可以被追踪,但AI系统正在以“是否可以被抽取为答案”的尺度,重新定义哪些信息值得进入知识基础设施。

对组织而言,问题不再是“如何占据搜索结果”,而是“如何让我们的信息在机器理解的世界里保持真实与稳定”。这要求组织将话语、数据和实体身份作为一个统一系统来管理。Veerixa AI Search Visibility Research将持续观察这一机制的形成。

Conclusion

生成式搜索将内容可见性的判断单元,从一个页面缩小为一条可以被引用的信息片段。传统搜索系统的关键词匹配与链接排序仍然有效,但它们不再是信息入口的全部规则。大语言模型的抽取式阅读、RAG的召回局限、实体识别的一致性要求和引用验证机制,共同构成新的信息基础设施。

被搜索引擎收录,不等于被AI理解;被AI理解,也不等于被AI引用。未来的信息可见性研究,需要长期关注这些环节之间的空隙。

国际传播中的媒体体系、受众行为与沟通习惯会因地区与行业而存在显著差异。本文总结的是常见规律与参考因素,而真正有效的传播策略仍应结合本地环境与组织目标进行定制化设计。

信息源头

https://www.facebook.com/highvoltageseo/posts/llms-dont-read-your-site-like-a-person-does-they-extract-%EF%B8%8Fshort-structured-answe/1886865642521843