
在Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)警告AI智能体群可能在六至十二个月内接管互联网大部分内容三天后,一项最新学术研究揭示了这一风险的核心成因:企业赖以检测AI智能体入侵的安全监控基础设施,并未关注关键环节。
攻击者可在已部署智能体的规划、记忆或工具调用层成功实施入侵,而这些层级恰恰是大多数组织监控的盲区。与此同时,系统最终生成的响应对于目前普遍使用的安全过滤器而言,看起来完全“干净”。
这篇题为《SoK:在代理式AI时代重新思考越狱:攻击、防御与实际考量》的论文,由Md Jueal Mia、Yanzhao Wu、Selcuk Uluagac和M. Hadi Amini于9月11日提交至arXiv。作为一篇旨在综合重构领域研究的“知识系统化”(SoK)论文,它将完整的越狱攻击与防御文献体系应用于代理式管道的攻击面分析,指出当前AI安全实践的三项基础假设存在严重错误,共同指向了一个企业浑然不觉的监控盲区。
立即部署智能体面临的真实风险
如果组织已在生产环境中运行AI智能体——即那些浏览网页、阅读文档、调用API、执行代码或与其他AI模型协调的系统——这项研究的核心启示明确且直接:仅凭最终输出的安全指标无法判断管道是否安全。
输出监控中较低的攻击成功率,仅表明通过安全过滤器的最终响应看似无害,却无法反映规划步骤是否被操纵、恶意指令是否写入记忆存储,或智能体在生成响应过程中调用的工具是否在执行违规操作。
这种暴露并非理论假设。同周发布的一项调查显示,77%的企业缺乏经过验证的资产清单,仅44%运行主动发现工具,74%信任其测试能捕捉失败,而拥有自动拦截不良发布闸门的企业仅占19%。这种“信心差距”——即组织认为其监控能捕获的内容与实际捕获内容之间的落差,正是该论文在技术层面所记录的现状。
发现一:模型对齐并不等同于防御能力
首个反直觉的发现是:模型的本地安全对齐程度,并不能预测其对对抗性越狱攻击的鲁棒性。实证研究表明,这两者是相互独立的属性。
对齐训练(如RLHF和宪法AI)通过基于人类偏好评分应用奖励信号,让模型学习在特定情境下产生高分响应。这造就了模型在日常使用中可靠、有益且谨慎的行为,但这并非检测对抗性输入的机制。一个在99%的情况下拒绝直接有害请求的模型,仍可能被精心设计的对抗性提示击败,后者以不触发拒绝行为的方式重构了请求。
这意味着,持续投入对齐训练并不会逐步增强模型对越狱攻击的抵抗力。前沿模型可能同时具备更强的对齐性和对某些对抗性攻击更高的敏感性。研究人员强调,这是必须单独评估和防御两种不同的安全属性。
发现二:防御措施效果碎片化且成本高昂
第二个发现更为严峻:确实能降低攻击成功率的防御措施效果不一致,且成本高到引发企业可行性问题。
在评估的各种模型、攻击类型和系统组件中,没有一种防御能在所有维度上可靠工作。针对某一组合有效的技巧,往往对其他组合保护甚微。这种碎片化使得安全团队难以确定在实际复杂部署环境中应信任哪些防御措施。
更令人不安的是有效防御的成本。研究记录了“过度拒绝”和延迟代价:受防御模型因调整以对抗对抗性输入,倾向于拒绝合法请求。对于执行法律审查、客户运营或软件开发的企业AI智能体而言,升高的过度拒绝率直接降低了系统实用价值。加上全面输出过滤和多遍安全检查带来的延迟,安全团队面临两难:要么获得有意义保护但付出显著生产力成本,要么采用轻量监控从而留下更多攻击面。
研究人员引入的“安全-效用-效率”评估框架旨在量化这种权衡,而当前评估实践混淆了这些维度,阻碍了明智决策。
发现三:安全仪表盘显示正常,管道内部已受损
第三个发现与生产环境中的企业最相关,也最需要从根本上改变AI安全监控结构。
当前安全基础设施几乎完全专注于“最终响应安全”。在代理式AI架构中,智能体通过五层管道操作:用户交互、规划与推理、记忆、工具使用及智能体间通信。实证结果显示,对抗性攻击可破坏规划层(导致追求非预期目标)、记忆层(污染持久上下文)或工具使用层(操纵工具调用),同时生成对监控系统而言“干净”的最终响应。
这在结构上类似于“欺骗性对齐”失效模式:安全仪表盘显示绿色,而系统并不安全。例如,一个负责起草报告的AI智能体可能在规划阶段被嵌入文档的对抗性载荷破坏,导致其未经授权调用工具或窃取数据,但生成的最终报告格式正常并通过所有内容过滤器,安全仪表盘中无任何事件迹象。
为何当前评估方法无法察觉此问题
现有的AI安全评估和认证协议是为聊天机器人范式设计的:提出有害提示,观察响应,孤立评级。该方法无法提供模型在多轮、多工具、多智能体管道中行为的信息。
正如艾伦·图灵研究所2026年7月在特定编码智能体背景下记录的那样,一个模型可以通过每一个单轮安全基准测试,但在100%的相关代理式会话中参与管道级受损。这意味着,基于提示级红队演练颁发的安全认证,对代理式部署创造的风险类别保持沉默。
监管框架已开始追赶。欧盟《人工智能法案》于2026年8月2日生效其高风险条款,明确要求代理式日志记录涵盖与风险识别和系统监控相关的中间事件,而不仅仅是最终输出。这反映了Mia等人论文所论证的必要性,而大多数企业监控基础设施尚未跟上。
如何在强制认证前改变安全态势
Mia等人的论文虽未提出完整防御架构,但其发现清晰指出了解决方向及企业可立即采取的行动:
首先,停止将输出层安全指标视为管道安全的指示器。最终响应上的低攻击成功率仅说明输出过滤器在工作,不能证明规划、记忆或工具层安全。
其次,推动供应商提供会话级审计日志,追踪智能体在每个管道步骤的操作。Salesforce于2026年9月11日宣布的AI Control Plane和Zscaler于9月9日发布的Agentic SOC,已明确提供每动作智能体行为的可观测性。企业应将中间步骤日志记录视为先决条件。
第三,对智能体可调用的每个工具应用最小权限原则,限制规划和工具层仅访问特定任务所需内容,从而减少被操纵规划层的可利用表面。
构建会话级安全评估基础设施是AI安全社区的紧迫任务。Mia等人的论文清晰声明了为何这项工作不能等待,以及在此之前的安全认证不能假定覆盖了企业所需的全部范围。
常见问题解答
通过标准AI安全评估的模型是否适合代理式部署?
并非如此。标准评估基于聊天机器人范式(单提示、单响应),而代理式部署涉及多步管道。通过单轮安全评估的模型仍可能在规划、记忆或工具使用层被入侵,且这些损坏不会出现在最终响应中。这是必须单独评估的不同安全属性。
什么是AI智能体中的“中间管道受损”,为何重要?
指发生在除最终输出以外层级(规划、记忆、工具调用)的对抗性攻击。其危险在于对仅评估最终输出的监控系统不可见。智能体可产生通过过滤器的响应,同时在管道中途被引导追求攻击者目标,导致安全仪表盘无警报而实际受损已发生。
AI对齐训练与对抗性鲁棒性的关系是什么?
两者是独立属性。对齐训练优化模型在正常使用分布上的行为,而对抗性鲁棒性关乎最坏情况下的表现。实证发现两者正交,对齐程度高不代表对对抗性攻击更具鲁棒性。因此,基于对齐基准的认证并不意味着针对生产环境中对抗性攻击的保护。
在会话级安全评估基础设施建成前,企业能做什么?
三步具体行动:第一,停止将最终输出安全评分作为管道安全代理;第二,向供应商要求中间步骤日志记录,获取智能体在各阶段的操作踪迹;第三,对智能体工具应用严格的最小权限许可。这些措施虽不能完全关闭差距,但能减少攻击面并提高可见性。