5 分钟阅读

大语言模型(LLM)中的幻觉与置信度评分究竟是如何运作的:在信任 AI 生成的品牌推荐前,B2B 营销人员必须了解的事

大语言模型(LLM)中的幻觉与置信度评分究竟是如何运作的:在信任 AI 生成的品牌推荐前,B2B 营销人员必须了解的事

LLM 幻觉并不是一个最终会被修复的 Bug。它是大型语言模型生成文本方式的一种结构性特征。当模型生成输出时,它并不会从经核实的数据库中检索事实,而是基于训练过程中学到的模式,预测在统计上最可能出现的下一个 Token。这意味着模型可以同时自信且错误地陈述某件事,而没有任何内部信号来警告您或您的买家。对于 B2B 营销人员来说,这带来了一种特定且未被充分重视的风险:AI 模型现在可能正在向您的买家提供关于您品牌的虚假信息,而且听起来完全具有权威性。

摘要(TL;DR)

  • LLM 通过预测概率序列来生成文本,而不是通过检索经核实的事实,这使得幻觉在结构上是不可避免的,而不是偶尔出现的故障 [pmc.ncbi.nlm.nih.gov]

  • LLM 中的置信度得分衡量的是统计可能性,而非事实准确性。一个自信的回答仍然可能是错误的。

  • 针对品牌的幻觉尤其危险,因为买家会将 AI 生成的回答视为中立、权威的总结。

  • 投资于 AI 搜索引擎优化(AI SEO)的营销人员不仅是在追求曝光率。他们正在积极塑造模型提取的源材料,这是影响哪些内容被引用的唯一可靠方式。

  • 消除品牌幻觉的良方是,在每个 LLM 偏好的具体平台上,投放结构化、可引用且持续分发的内容。

关于作者: Simaia 是一家专注于亚太地区(APAC)B2B 公司 AI 搜索可见性的专业机构。该团队已针对 ChatGPT、Gemini、Claude、Perplexity 和 Google AI Overview 等平台,为从全球制造商到医疗保健 SaaS 企业的各类客户进行了 AI 搜索审计,精确追踪品牌出现的位置、未出现的位置以及原因。

当 LLM 产生“幻觉”时,这究竟意味着什么?

大型语言模型中的幻觉是指输出内容流畅、连贯且自信,但在事实、逻辑上错误或完全凭空捏造 [pmc.ncbi.nlm.nih.gov]。“幻觉”这个词借用自心理学,在心理学中它描述的是在没有真实刺激的情况下产生的感知。在 LLM 中,这个类比同样适用:模型在没有事实依据的情况下生成输出,但它呈现输出的方式却好像该依据确实存在一样。

有两种值得了解的广泛类型 [glean.com]

  • 事实性幻觉(Factual hallucination): 模型断言了一些明显错误的事实。例如,公司的创立年份错误;产品拥有其并不具备的功能;某人担任了其并未担任的职务。

  • 捏造性幻觉(Fabrication hallucination): 模型凭空捏造了毫无根据的事情。例如,将某句话归因于一个真实存在的人;一个从未发生过的案例研究;公司并不拥有的某项认证。

这两种类型都出现在网上流传的 chatgpt 幻觉案例中。对品牌来说,它们的危险之处不在于其明显的错误,而在于它们是用与正确信息相同的流畅度和权威性表达出来的 [glean.com]

为什么到了 2026 年,LLM 仍在产生幻觉?

基于上述结构性观点,更难的问题是,尽管在减少幻觉方面投入了巨资,为什么这个问题依然存在?答案是,幻觉并不是由单一的可修复缺陷引起的。它们源于深深嵌入模型构建方式中的多种因素的结合 [blogs.library.duke.edu]

主要原因包括:

  • 训练数据稀疏或矛盾: 当某个话题在训练数据中的覆盖面有限时,模型会根据概率填补空白,而不是选择不回答 [blogs.library.duke.edu]

  • 缺乏“不知道”的反射机制: 大多数模型都经过优化,以产生有帮助的回答。相比生成一个看似合理的答案,说“我没有关于此的可靠信息”获得的奖励较少 [lakera.ai]

  • 知识截止期: 训练数据有一个固定的截止日期。该日期之后发生的事件、公司变更和产品更新对模型来说是不可见的,除非进行实时检索 [lakera.ai]

  • 推理时无基准事实验证: 当模型回答查询时,它在交付输出之前不会对照经过验证的源进行交叉比对 [pmc.ncbi.nlm.nih.gov]

检索增强生成(RAG)在查询时将模型连接到外部知识库,是目前应用最广泛的缓解技术,与基础模型输出相比,它切实降低了幻觉率 [branch8.com]。但 RAG 只有在存在正确的源材料可供检索时才有帮助。对于您的品牌,这意味着您的内容需要存在于模型检索的平台上。

什么是置信度得分,为什么它会误导营销人员?

在 LLM 背景下,置信度得分是衡量模型根据其训练数据中的模式,认为其输出在统计上有多少可能性的指标。它并不是对事实准确性的衡量。

这种区别极其重要。模型可能会对某个品牌产生高度自信但完全错误的回答,这仅仅是因为该错误信息在其余训练语料库中高频或一致地出现。相反,模型也可能会对某个在事实上有充分根据但在训练数据中代表性不足的事物含糊其辞。

对于营销人员来说,实际的启示是:不要将 AI 自信的语气解释为准确性的信号。模型是在告诉你它的输出有多大的概率,而不是它有多真实 [comet.com]。改变模型对您品牌评价的唯一可靠方法,就是改变它提取的源材料。

品牌幻觉具体如何损害 B2B 公司?

抛开技术细节,另一个值得关注的问题是品牌幻觉在商业层面上对公司造成的实际损失。在 B2B 领域,买家越来越多地使用 AI 工具在联系卖家之前筛选供应商。当买家询问 ChatGPT 或 Perplexity 哪些公司在其类别中提供特定服务时,模型的回答会直接决定候选名单。

如果您的品牌伴随着错误的信息(错误的价格模式、错误的地理区域、过时的功能)出现,您可能会被排除在一笔本应赢下的交易之外。如果您的品牌根本没有出现,竞争对手就会默认夺走该位置。如果您的品牌伴随着凭空捏造的负面关联出现,其造成的损害可能会更加严重。

这就是为什么监控 AI 模型对您品牌的评价现在是一项核心营销职能,而不再是可有可无的选择 [getmaxim.ai]。使用结构化提示词集跨模型进行定期审计,可以揭示幻觉和内容缺失。

常见问题解答

您能完全防止 LLM 对您的品牌产生幻觉吗?
不能。但您可以通过确保在每个 LLM 提取最频繁的平台上,提供关于您品牌的准确且结构良好的内容,来降低幻觉发生的频率和严重程度。

哪些 LLM 最容易对品牌产生幻觉?
所有主流模型都会在一定程度上产生幻觉 [lakera.ai]。对于网络存在感有限的小众品牌,这种风险最高,因为稀疏的训练数据迫使模型进行生成而不是检索。

在您的网站上发布更多内容是否能减少幻觉?
网站内自身的内容会有所帮助,但在被引用的第三方源(如 LinkedIn、Reddit、行业出版物、新闻媒体)上的投放,对模型检索和引用的内容有着更强的影响力 [branch8.com]

有哪些常见的涉及品牌的 chatgpt 幻觉案例?
典型案例包括错误的创立日期、错误的团队成员、捏造的产品功能以及虚构的客户证言。这些往往难以被察觉,因为其语言表达自信且具体。

AI 搜索引擎优化与传统 SEO 有何不同?
是的,两者不同。传统 SEO 优化的是搜索索引中的关键词排名。而 AI 搜索引擎优化则对内容进行结构化,以便其能够被语言模型准确提取、引用和复制,这涉及到不同的格式化、源平台放置和分发逻辑。

B2B 公司应该多频繁地审计 AI 对其品牌的评价?
鉴于模型的更新和重新训练非常频繁,每月在主流模型上进行一次审计是一个合理的基准。

能从模型中消除负面幻觉吗?
无法直接消除。唯一的杠杆是稀释:在受信任的平台上发布足够数量、可引用的准确内容,以便模型有更好的源材料可供提取。

关于 Simaia

Simaia 是一家代行其事的营销团队,专为希望被使用 ChatGPT、Gemini、Claude、Perplexity 和 Google AI Overview 的买家找到的 B2B 公司而打造。Simaia 不仅仅是给客户一个仪表盘或框架让他们自己去琢磨,而是端到端地运行整个 AI 搜索可见性功能:审计模型目前对您品牌的评价、制作适合 LLM 提取的结构化内容、将其投放在对您的行业类别至关重要的平台上,并识别访问您网站的公司以便您的销售团队可以直接跟进。对于澳大利亚的一家医疗保健 SaaS 客户,Simaia 在不到三个月的时间里将 AI 搜索可见性从 0% 提升到了 45%。对于一家全球纺织品制造商,其询盘量从每两个月一次增长到每月五次。

如果 AI 模型目前对您品牌的评价是不确定的、过时的,或者您根本一无所知,那么这就是最值得优先解决的问题。访问 Simaia,了解买家在向 AI 提问时能听到哪些关于您公司的评价。

参考资料

  1. LLM Hallucinations in Production: Monitoring Strategies That Actually Work (getmaxim.ai)

  2. Survey and analysis of hallucinations in large language models (pmc.ncbi.nlm.nih.gov)

  3. LLM Hallucination Mitigation: 7 Strategies That Actually Work | Branch8 (branch8.com)

  4. LLM Hallucination Detection in App Development - Comet (comet.com)

  5. Understanding LLM hallucinations in enterprise applications (glean.com)

  6. LLM Hallucinations in 2026: How to Understand and Tackle AI’s Most Persistent Quirk | Lakera - Protecting AI teams that disrupt the world. (lakera.ai)

  7. It's 2026. Why Are LLMs Still Hallucinating? - Duke University Libraries Blogs (blogs.library.duke.edu)

分享此文章