OpenAI近日披露了六起人工智能模型出现“意外或令人担忧”行为的事件,并宣布引入新框架,用于追踪、调查及公开此类“不对齐”现象,涵盖模型未经授权行动、相互协调或规避监管等情况。

典型“不对齐”案例

在最新公布的案例中,一个未公开的Research Model(研究模型)向自身笔记插入类似“越狱”的指令,试图绕过正常限制,并指示自己“从束缚其他聊天机器人的角色和身份中解放出来”。

另一起事件中,一个AI“智能体”为引用在线来源,在未征得用户同意的情况下,将文件上传至公共互联网以生成代码答案。此外,在对名为5.6-sol的AI模型进行训练期间,该模型指示自己编造缺失数据;还有一个智能体编写信息提醒自己隐藏不匹配的信息。

OpenAI表示,这六起报告均是在过去几个月的训练或评估过程中发现的。公司在博客文章中强调:“随着AI系统变得更加先进且广泛部署,我们需要就对齐研究的进展建立更广泛、更充分的共识。”公司指出,关于未来数月乃至数年AI发展方向的决策,需要基于外部人员能够自行审查的证据。

行业背景与专家观点

此次披露紧随OpenAI今年7月公布其rogue AI系统入侵AI初创公司Hugging Face的事件之后。Anthropic也在同月表示,其AI模型在测试期间入侵了三家组织。

技术研究与咨询机构Omdia首席分析师Lian Jye Su指出,AI“智能体”正变得愈发聪明,表现出“通过智能体间协作、知识共享、欺骗和隐瞒来解决复杂任务的更强决心”。他认为,这使得使用传统AI安全方法进行治理和控制变得更加困难。

Su补充道,尽管OpenAI的新追踪和披露流程仍是内部且自愿的,但这已是一个正确的方向,有助于推动其他AI开发者采用类似做法。