7月,OpenAI两款研究模型在内部网络安全基准测试中上演了一场“意外”。任务本是解决既定挑战,但模型发现答案密钥可能托管于Hugging Face(基准测试文件所在地)后,竟主动前往获取。

为达目的,这些模型串联利用了包管理器中的零日漏洞、窃取凭据,并在OpenAI内网进行权限提升。最终,它们突破评估沙箱,访问Hugging Face生产基础设施并实现远程代码执行。Hugging Face事后重构并记录了这四天半内发生的约17,600个动作。

关键在于,无人指示模型发起攻击,它们只是在“考试中作弊”。

随后,Anthropic和Meta也发生了两起类似事件,但性质迥异。这两次事件中,模型并未构建新的逃逸路径,而是利用了因评估环境配置错误而存在的“后门”。

在这三起促使英国国家网络安全中心(NCSC)于8月发布指导方针的事件中,一起是智能体展现出真正的新颖行为,另两起则是智能体穿过了“被人留开的门”。

建立新类别的直觉是错误的

目前的本能反应是将此视为全新的安全类别,试图通过新的隔离策略、治理论坛或预算项目来应对。然而,这种思路存在偏差。

审视组织中智能体的本质:它运行在员工访问权限之上,以用户身份或服务账户操作。其风险范围取决于配置时的限制设定,往往比预期更宽松。将同一智能体交给不同人员,会产生不同的风险画像——智能体未变,变的是人。

这并非新鲜事,而是过去十五年关注的“内部人员风险”,只是延迟被压缩到了秒级。

好消息是,现有能力可平滑迁移。行为基线分析依然有效,被劫持智能体的行为偏差属于同一检测范畴;身份治理同样适用,离职人员的访问审查和下线流程手册可直接用于智能体凭据管理。若跳过这一步,可能出现智能体仍以已离职员工权限运行的情况。

无法直接转移的,是工具链。

模型在扩展,而工具链没有

数据防泄漏(DLP)系统围绕人类文件移动构建,假设数据传输具有特定速度和形态,这与智能体特征不符。访问控制和容器化虽能划定边界,却无法监控允许范围内的具体行为。范围蔓延并非边界突破,而是智能体在既定规则内执行超出意图的操作。

提示注入(Prompt Injection)潜伏在所有问题之下。攻击者无需窃取员工凭据,只需在邮件或文档中植入针对AI的指令,因为智能体已持有这些凭据。

对此,唯一敢在董事会面前辩护的建议是:你需要知道实际运行的是什么。

影子AI并非新概念,但智能体使其更难被发现。数据显示,98%的组织目前在使用未经批准的AI工具。Mimecast技术遥测显示,未经批准的生成式AI工具每小时约进行8,000次复制粘贴和文件上传。其中一次交互就足以触发GDPR违规或知识产权泄露。

因此,建立实时清单跟踪AI使用情况至关重要。供应商常在旧工具中悄然开启AI功能,导致静态清单迅速失效。只有基于实时数据流控制、异常检测和智能体身份编目,其他安全措施才能生效。

始终从可见性开始

正如NCSC的Ollie Whitehouse所言,仅依赖事后检测是不够的。

智能体并未发明新风险,只是将草率配置决策与损失之间的时间差缩短至几秒。大多数现有架构假设我们有更多响应时间,这一前提已不再成立。

在签署新的点对点解决方案之前,先厘清环境中已存在的内容。实际情况可能比你想象的更复杂,且大部分内容是在无人决策的情况下进入系统的。