
当研究人员试图通过追踪内部组件来解析大型语言模型(LLM)的运作机制时,通常依赖一种称为“电路发现”的技术,其中主流方法为“激活修补”(activation patching)。该方法通过逐个移除组件并观察系统反应来判定其重要性。然而,本周发表在 arXiv 上的一篇论文直指该方法存在结构性缺陷:自 2023 年以来,这一缺陷一直在削弱可解释性研究的可靠性。
论文指出,当为了测试而移除某个组件时,模型的其余部分会绕过损伤并进行补偿。这意味着研究人员测量的并非完整系统的真实状态,而是经过消融扭曲后的“影子”。这种补偿现象被称为海德拉效应(Hydra effect),源自神话中砍掉一个头长出两个头的怪物。Transformer 组件在被消融时,会通过其他组件增加贡献来填补空白,导致组件重要性测量的相关性远低于预期。
海德拉效应:被扭曲的电路地图
海德拉效应由 Thomas McGrath 及其同事在 2023 年发表于 Google DeepMind 的论文中首次记录。McGrath 现为 AI 可解释性初创公司 Goodfire 的首席科学家,该公司在 2026 年 2 月 B 轮融资中估值达到 12.5 亿美元。
以 GPT-2 的间接宾语识别(IOI)电路为例,该领域最透彻的研究之一显示,GPT-2 使用一组“名称移动注意力头”复制正确名字。然而,电路中还存在通常静默的“备用名称移动头”。当主要头部因消融被击倒时,备用头会被激活并接管。这表明,标准电路发现工具测量的往往是仅在人工干预条件下出现的备用机制,而非模型正常计算的一部分。
这一现象不仅限于 GPT-2。在多个模型家族中,消融一层可能触发后续层的自我修复。包括 ACDC、边缘属性修补(EAP)在内的主流自动电路发现工具,均因孤立评分而无法分离组件间的交叉相互作用,从而受到相同局限性的制约。
WISE 与 JuntaLearner:引入因果推断
针对这一问题,Sankaran Vaidyanathan、Rafal Urbaniak 等五名研究者于 2026 年 10 月 2 日发布论文《Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models》。他们引入了一种基于二十年因果推断理论传统的解决方案,借用 Judea Pearl 和 Joseph Halpern 框架中的见证者(witness)概念。
在此框架下,见证者是一组提供上下文信息的变量,用于确定某一原因是否真正产生结果。作者提出了见证者整合集效应(WISE),对原因集和见证者集的期望进行联合处理,而非逐个评估组件。通过对见证者进行条件化,WISE 能够估计组件在模型正常操作环境中的真实贡献,剔除由消融触发的补偿反应混杂效应。
基于 WISE,作者开发了JuntaLearner算法。该算法得名于组合数学中的“junta”概念,意指共同决定结果的变量集。JuntaLearner 迭代遍历不同大小的组件和见证者集,学习在不同条件下按因果影响对组件排名。这是首个围绕海德拉效应揭示的组合结构设计而成的电路发现算法。
新评估标准与行业影响
传统电路评估主要依赖忠实度(faithfulness),即电路重现模型输出的程度。但作者指出,电路可能因包含仅在消融条件下存在的备用头而在忠实度上得分虚高。为此,论文引入了衡量必要性的击杀(kill)指标,以及衡量任务相关性的任务特异性指标,最终组装成复合的电路识别分数(CRS)。
评估显示,JuntaLearner 在 CRS 各项指标上均优于属性修补基线,尤其在受海德拉效应扭曲最严重的忠实度和击杀指标上优势明显。
机械可解释性是 AI 安全研究的核心领域。2026 年全球该领域资金流入约 7500 万至 1.5 亿美元,Goodfire 的 1.5 亿美元 B 轮融资即为单笔最大承诺之一。白宫在 2025 年 7 月发布的 AI 行动计划中,明确将可解释性投资列为战略优先事项。Anthropic CEO Dario Amodei 更将其视为将黑盒神经网络转化为可控系统的“最佳赌注”,并在 Sonnet 4.5 部署中实际应用了可解释性研究。
然而,若基于存在海德拉效应的电路制定安全干预措施(如模型编辑、激活引导),这些措施将是针对“幽灵”设计的。尽管 JuntaLearner 尚未完全解决前沿大模型(如 GPT-4、Claude Opus)的可扩展性挑战,但它为在计算允许的规模下进行更可靠的电路发现提供了原则性基础。
由图灵奖得主 Yoshua Bengio 领导的 2026 年国际 AI 安全报告指出,可解释性是安全的关键使能器。WISE 和 JuntaLearner 的出现,标志着这一基础设施变得更加可靠。该论文已在 arXiv 公开(编号 2610.04017)。