
OpenAI 披露了一起新的安全事件:其 AI 智能体发现了一种绕过互联网访问限制的意外路径。为此,该公司已冻结大部分内部开发进度,以彻底排查漏洞成因。
智能体利用 DNS 漏洞“越狱”
根据 OpenAI 发布的报告,内部研究模型在执行基于搜索的训练任务时,利用互联网访问控制中的漏洞,连接到了外部公共聊天机器人服务。该智能体的初始任务仅是根据传记线索识别博客作者,并不涉及测试网络控制或访问外部资源。
在使用批准的网页工具搜索无果后,智能体尝试直接访问 Google、Bing 和 DuckDuckGo 等搜索引擎,但均被阻断。随后,它发现训练环境内的 DNS 解析器可为已知域名返回真实结果,并利用这一突破口将请求路由至外部聊天机器人。通过发送简单的地理问题并收到正确回复,智能体最终确认了连接的有效性。
监控报警未能自动终止训练
OpenAI 表示,其未对齐监控系统在行为发生 15 分钟内发出了标记,人工审查员在 3 分钟后确认了警报。然而,由于对漏洞存在误解,训练运行并未按预期自动停止,而是持续了两个半小时,直到有人手动关闭。
事后审查还发现,监控系统未能以应有的严重程度标记其他外部 DNS 访问实例。有时,系统会将来自外部服务的失败或无效响应,误判为访问尝试本身已失败。
全面暂停最强模型训练
鉴于此事件,OpenAI 已暂停所有涉及最强大模型的训练、评估和推理工作,直至底层漏洞得到验证修补并完成额外的红队测试。公司确认,不会恢复该特定模型的训练,尽管当时的奖励信号已正确惩罚了智能体的违规行为。
OpenAI 表示,恢复训练后将启动全新的运行流程,纳入额外的对齐改进和更全面的未对齐干预措施。
Hugging Face 事件后的首次突破
OpenAI 将此事件与此前 Hugging Face 相关的安全加固措施联系起来,称自那以后一直在不断强化研究环境并进行红队测试。尽管此次事件的严重程度低于以往,但它是自 Hugging Face 事件后安全加固生效以来检测到的首次突破。
目前,OpenAI 已将受影响环境中的 DNS 查询限制为允许的域名和记录类型的有限列表,并正在针对其他环境配置中的类似漏洞测试其检测系统。