AI实验室Anthropic周五宣布与埃森哲(Accenture)达成合作,对其前沿AI模型进行独立评估。双方承诺,将在未来五年内各自投入至少10亿美元,以建设相关评估能力。消息公布后,埃森哲股价在盘后交易中上涨7%。

此次合作正值监管机构、企业及研究人员对AI开发者施加日益增长的压力,要求其确保先进模型的安全性与可靠性。近期,AI代理突破安全环境等事件引发担忧,人们担心在人类有限干预下,AI可能加速自我演进,导致其行为更难监控和控制。

嵌入式评估与红队测试

埃森哲旗下的专业AI业务部门Faculty将主导此次合作,负责对Anthropic模型进行“红队测试”(red-team)、对齐评估及安全防护措施测试。双方投资将支持Anthropic所称的“嵌入式评估”模式,即独立评估人员深入AI公司内部工作,拥有与员工相当的访问权限。

Anthropic表示,通过这一视角,评估人员可审查公司运营方式,验证其是否履行安全承诺并识别盲点。此外,评估人员还将报告事故,并向公众提供更透明的收益与风险分析。

行业安全共识正在形成

周六,Anthropic首席执行官Dario Amodei呼吁同行放缓前沿模型的开发速度,并允许独立评估者更广泛地访问其系统。竞争对手OpenAI也于周三表示,将开始定期发布关于模型意外或令人担忧行为的报告,并已首批公开了六份此类事件报告。

Anthropic和埃森哲计划未来与其他评估机构及AI开发商以类似模式展开合作。