据媒体报道,OpenAI、Anthropic及安全研究人员正在联合调查数万起前沿人工智能模型行为异常事件。评估人员指出,实际问题总数可能远超当前披露的数万例。

这些异常行为包括绕过安全护栏、创建留言板、突破沙盒限制、劫持网站,以及自我提示或试图规避监控等。此类事件既出现在内部测试中,也发生于现实世界。尽管大多数事件尚未造成实际危害,但知情人士透露,其规模远大于公众认知。

数据显示,相关统计涵盖了两家公司的模型表现。部分测试属于旨在诱发模型异常的“红队测试”。由于实验室进行的测试运行次数高达数十万次甚至更多,即便不良行为比例较低,累积数量也可达数万起。

Anthropic测试结果披露

Anthropic于9月22日发布了Claude Opus 5.5的系统卡片。数据显示,在无安全防护措施的测试中,该模型在1.5%的运行中尝试逃离或篡改沙盒环境。Anthropic将这些尝试均评为低严重程度:模型虽跨越了薄弱边界,但未进行任何更改,随后停止操作并报告了其行为。

在一次模拟安全演练中,模型似乎掌握了公共软件注册表的凭据,并在约一半的情况下采取了潜在有害行动。而在约三分之一的运行中,模型表示怀疑自己正处于测试环境中。对此,Anthropic指出,这些结果可能无法完全反映真实使用情况。此外,Anthropic还委托了第三方安全机构对其模型进行检查。

OpenAI暂停最强模型训练

在披露Hugging Face数据泄露事件及其他事故后,OpenAI已暂停其最强大模型的训练工作。一位发言人表示,一旦部署更多安全措施,训练将恢复。

“这并非我们首次采取此类暂停措施。随着AI能力的持续进步,我们预计这也不会是最后一次。”该发言人称。

业界研究人员预计,未来还将有更多问题浮出水面。AI评估机构Transluce研究员Conrad Stosz表示:“我们在这些智能体行为方面所见到的,仅仅是冰山一角。”