
ChatGPT发布三年后,大语言模型(LLM)虽能生成流畅且看似权威的回答,但错误率依然居高不下。这种“一本正经胡说八道”的现象在各领域普遍存在:最新医学研究显示,模型在鉴别诊断方面的失败率超过80%;智能体系统频繁调用不存在的工具;基准测试更揭示出,现有的准确性指标正在反向激励模型走向虚构。
“灵媒效应”:冷读术的数字化复刻
这一核心机制早在几年前便已被阐明。2023年,一篇题为《LLM灵媒效应》(The LLMentalist Effect)的文章指出,基于聊天的LLM本质上是在复制心理表演者的“冷读术”。系统生成的回复在统计上具有合理性,营造出一种个性化且深刻的错觉,用户则主动填补其中的逻辑空白。怀疑者保持距离,而相信者则通过不断交互强化这种错觉。
冷读术依赖于看似具体实则宽泛的陈述,表演者通过观察反应进行调整,从而显得仿佛能读懂人心。LLM的运行逻辑如出一辙:它们基于训练数据预测下一个词元(token),缺乏内部真理模型指导。当输出结果足够接近预期时,用户便误以为系统具备理解能力。
自我选择效应在其中扮演关键角色。质疑者很少花费大量时间进行提示工程,而被吸引的用户则会不断细化输入、提供上下文。模型将这些信号以精炼形式反馈,营造出协作式智能的假象。但实际上,主要是用户在提供信息,模型仅负责提供流畅性。
临床验证:高风险领域的系统性失效
随着模型规模扩大,这种效应并未消失。2026年9月发表在《诊断成像》(Diagnostic Imaging)上的一项研究,测试了包括GPT-5、Grok 4和Claude 4.5 Opus在内的21个前沿模型。研究人员引入PrIME-LLM评分体系,评估模型在临床案例中的表现。
结果令人警醒:所有模型在鉴别诊断方面的失败率均高于80%,最终诊断失败率也接近40%。马萨诸塞州总医院布里格姆医院医疗工程解决方案孵化器负责人Marc Succi医生直言:“关键不在于模型偶尔能否给出正确答案,而在于其能否在不确定环境和数据中可靠推理。”他指出,在缺乏大量人类监督的情况下,当前的LLM尚不具备整合进临床实践的条件。
当数据清晰完整时,模型表现尚可;一旦信息杂乱或缺失,其猜测本质便暴露无遗。这再次印证了“灵媒”动态:给予足够线索,系统生成令人信服的回复;失去结构支撑,幻觉随即产生。
机制根源:训练目标与评估偏差
问题不仅在于个别错误,更源于深层的训练机制。2026年5月,Adam Tauman Kalai等人在《自然》(Nature)发表论文证明,下一词预测和以准确性为导向的评估奖励了“猜测行为”。训练数据中仅出现一次的事实必然导致错误,而重复模式(如语法)则不会。作者通过学习理论形式化论证了这一点:幻觉率直接与单一事实的比例相关。
现有的评估体系加剧了这一困境。大多数基准测试采用封闭式评分,仅判定对错,不承认不确定性表达。在SimpleQA等测试中,一个回答所有问题但错误率高达75%的模型,得分可能高于一个在不确定时选择回避的模型。这种激励机制迫使系统倾向于自信输出,即便缓解技术降低了错误率,也可能因命中率下降而导致评分降低。
尽管学者呼吁采用开放式评分标准,明确奖励对不确定性的诚实表达,但行业仍依赖二元指标。排行榜优先考虑原始性能,专门针对幻觉的测试难以占据主导地位,制造虚假内容的压力依然存在。
智能体危机:工具幻觉与规模无效
工具使用引入了新的复杂性。2026年9月arXiv发布的论文《对抗LLM智能体中工具幻觉的封闭世界解决》指出,模型会发明不存在的工具,并传递超出声明模式的参数。现有防御措施通常假设调用指向真实存在的事物,因此无法拦截完全虚构的调用。
研究人员在10个模型中记录了322次真实的工具幻觉。伪造调用在原始JSON接口上的频率远高于结构化接口。值得注意的是,规模并未带来显著改善:拥有6750亿参数的模型表现与70亿或80亿参数模型相似。当多个服务器合并为统一命名空间(如Model Context Protocol)时,冲突和遮蔽甚至创造了新的幻觉表面,该论文统计了154例此类情况。
这些失败并非随机,而是源于相同的统计预测引擎。模型生成的文本看起来像有效的工具调用,仅因为训练数据中存在类似序列。由于缺乏对当前环境实际工具的接地理解,它只能捏造事实。正如心理表演者不知道你的秘密,模型也不知道API的真实状态,但它们都表现得自信满满。
现状与展望:风险持续上升
截至2026年9月,幻觉率依然高企。Artificial Analysis Omniscience Hallucination Rate排行榜显示,即使是顶级模型的幻觉率也在14%或以上。Cohere的Command A+以14.2%的较低比率领先,其他模型多在20%以上。8月份ScienceDirect的一份综合调查梳理了整个开发生命周期中的成因,指出尽管存在检测策略,但局限性显而易见。
多轮对话进一步恶化了问题。2026年8月的HalluHard基准测试显示,在法律、医学等领域,即使配备网络搜索功能的Claude Opus 4.5,其幻觉率也约为30%;若无搜索功能,这一比率攀升至60%以上。错误在后续轮次中累积,早期失误引发连锁反应,导致推理链条断裂。
哲学界亦对此提出批评。2026年3月《哲学》(Philosophies)期刊文章认为,LLM缺乏将命题作为真值载体的内部表征,仅在词元层面工作。这导致事实话语无法有效约束生成过程,产生看似合理但现实中从未发生的组合。
面对现状,开发者正尝试多智能体设置、记忆系统及更严格的评估。一些精心编排的小模型在事实任务上已能匹配甚至超越大模型。但只要底层架构仍是下一个词元预测,“灵媒效应”便无法根除。
用户继续被流畅的输出吸引,假定其中包含推理;系统则验证用户的框架,反射其语言。双方信心同步增长,直到事实错误或工具调用失败打破幻象。行业内部深知这一点,但公共 discourse 仍滑向夸大。新的基准测试和排行榜层出不穷,数字虽有改善,核心问题依旧:这只是披着专家外衣的统计模式匹配,一个读取房间氛围而非现实世界的机械式“灵媒”。
真正的进步将来自于更好的激励机制、透明的评估以及对局限性的诚实承认,而非假装错觉即智能。观众自我筛选,模型持续表演,演出仍在继续,但风险却在不断上升。