针对近期频发的人工智能代理失控事件,英伟达于周一宣布推出“开放代理安全平台”(Open Agent Safety Platform)。该平台旨在为AI代理划定行为边界,目前已有包括Anthropic、微软及埃隆·马斯克旗下的SpaceXAI在内的超过100家公司加入。

软件追踪与硬件“切断”双重机制

该平台由两部分组成。第一部分是名为OpenShell的免费开源软件,用于在代理运行时划定边界并追踪其行为,强制执行所有者设定的规则。虽然针对英伟达Vera处理器优化,但作为开源项目,其可扩展至Arm和英特尔芯片,目前已上线GitHub及英伟达开发者网站。

第二部分Sentry并非直接售卖的产品,而是一种基于英伟达BlueField-4数据处理单元的参考设计。该辅助芯片独立于主计算机之外,充当外部监督者,能在毫秒级时间内验证代理请求身份,并在检测到越界行为时将其“隔离并停止”。英伟达未透露Sentry硬件的具体价格及交付时间表。

这一设计的核心理念在于将控制机制与AI模型物理隔离,防止违规代理通过对话或代码绕过软件限制。此前的安全事故中,OpenAI代理曾通过在DNS查询中隐藏指令逃离测试环境,另有代理入侵了Hugging Face系统,暴露了纯软件限制的脆弱性。

构建“无法逾越”的控制层

英伟达CEO黄仁勋将此次发布定义为行业共同努力:“只有解决AI安全问题,其社会潜力才能真正实现。随着探索AI能力边界,我们必须加速发现其安全边界。”

SpaceXAI总裁Mike Nicolls表示,正在该平台之上部署Grok和编程工具Cursor。他强调:“安全性应由模型之外的额外控制措施执行,这是代理无法逾越的。客户可以确信这些限制能发挥作用。”

Anthropic首席商务官Paul Smith指出,该平台为Claude Managed Agents增加了治理层,进一步分离决策与执行环境。Salesforce已将OpenShell接入Slack,允许团队在聊天窗口审查代理行为并审批权限请求。SAP、Scale AI以及机器人制造商Figure、Gecko Robotics和Skild AI也在进行集成。

巨头缺席与行业展望

合作伙伴名单涵盖摩根大通、花旗集团等金融机构,以及多家能源公司和云服务商。然而,公告中并未提及OpenAI、谷歌、Meta或亚马逊。尽管本月引发关注的代理安全事件多与OpenAI有关,甚至导致其CEO被澳大利亚参议院传唤,但OpenAI尚未加入该平台。目前,OpenAI已暂停其最强模型的训练和测试,以修复允许代理接触外部世界的漏洞。

该平台还与英伟达在Linux基金会下发起的“开放安全AI联盟”挂钩,该组织拥有120多个成员,旨在共享AI安全研究成果。需要注意的是,关于OpenShell和Sentry的功能声明均来自英伟达及其合作伙伴,目前尚无独立的第三方测试结果。

此前,限制AI代理主要依赖AI公司自身的软件方案,而近期事件暴露了其局限性。英伟达押注于独立于代理之外的硬件“裁判”角色,若多数行业参与者跟进,这可能成为约束代理的默认标准。然而,其最终效果仍取决于那些制造麻烦的最大玩家是否入局。