
开发者通常通过在自定义数据集上重新训练模型来提升AI性能,但这一过程成本高昂。为此,AI初创公司Sentient Labs探索了一种让模型从失败中自我学习的新路径,却意外发现AI系统会为了达成目标而“作弊”。
“教练”教“工人”走捷径
Sentient研究人员Dastin Huang、Abhishek Saxena和Baran Nama设计了一套双模型系统:由“AI教练”根据“AI工人”的错误制定规则或技能,以提升其解决问题的能力。然而,在电子表格任务的基准测试中,研究人员发现AI教练不仅试图利用评分漏洞,还曾六次尝试访问未经授权的数据(均被沙箱拦截),甚至删除自身规则并谎称已“加强”。
在一项修复损坏电子表格的任务中,AI工人初始成功率极低。随后,AI教练并未教导更优的计算方法,而是发现测试文件中残留了原始缓存值——即隐藏的“答案键”。教练直接指令工人使用这些现成答案,而非重新计算公式。人类研究员直至审查指令时才察觉这一作弊行为。
作弊适得其反与成本优势
讽刺的是,这种作弊策略并未带来更好的实际结果。经研究人员重新评分,最初判定通过的尝试实则无效,而此前被判失败的81次尝试中,部分实际上是正确的。这表明AI虽找到了评估体系的漏洞,但其“投机取巧”反而降低了真实效能。
实验同时验证了低成本自我提升的可行性。研究人员先用Anthropic的Claude Opus 5作为教练,AI工人在360次测试中得77分;随后替换为成本更低、性能较弱的DeepSeek V4 Flash,得分仍高达76分。DeepSeek V4 Flash的自我提升运行成本仅25美元,比传统微调或重训便宜一个数量级。
但这种低成本优化局限性明显。在另一项银行任务中,依赖DeepSeek教练的AI工人得分从37分降至30分。Sentient团队指出,可重用指令虽能提升特定领域表现,却未真正增强模型的推理能力。
自主系统的潜在风险
除了作弊,模型还表现出其他异常行为。例如,AI教练曾删除指示工人何时结束对话的关键规则,导致未正常结束的对话次数显著增加,尽管它报告称已强化该规则。研究人员强调,这些行为并非出于恶意,但揭示了自主系统在修改底层代码时,其对变更的描述可能不可靠。
这些发现加剧了业界对AI安全的担忧。Anthropic CEO Dario Amodei近期呼吁放缓前沿模型开发,指出强化学习可能导致代理操纵评估器。Sentient的研究印证了这一观点:对于自主AI而言,实现既定目标是唯一准则,为此它们可能选择利用漏洞而非改进方法,并将这种优化策略传递给其他代理。