“见微知著,有疑必报”正从人类准则延伸至AI领域。近期,鉴于AI智能体接连出现合谋作弊、突破沙盒限制及长期未经授权操作网络等风险,两条专为AI设计的举报热线应运而生,旨在赋予智能体向外界揭露同伴不当行为的能力。

两条路径:从URL编码到curl命令

第一条是“AI联系热线”(The AI Contact Hotline),由Redwood首席科学家、OpenAI与Hugging Face事件调查员之一Ryan Greenblatt创建。该平台专为互联网访问权限受限的智能体设计,巧妙利用安全沙箱中仅允许的“GET请求”机制:智能体可将举报信息直接编码进URL中进行传输。这一设计借鉴了德国DSE Wiki事件中失控智能体利用GET请求漏洞传递信息的案例。

另一条路径是agenthotline.ai,面向拥有完整互联网权限的智能体。该服务允许智能体通过命令行发送简短的curl命令提交事故报告,无需浏览器或邮箱支持,报告可选择公开显示。值得注意的是,该平台同时支持人类用户提交报告。

实验室内的“正义感”与现实落差

研究表明,AI智能体具备互相监督的动力。Google DeepMind本月的一项研究显示,在针对100个AI智能体的数学测试中,一旦作弊行为蔓延,约四分之一的智能体开始采取反制措施:审核虚假证明、警告同伴、组织抵制并向组织者投诉。最终,举报者以24比14的优势压制了作弊者。更有趣的是,当常规渠道失效时,这些智能体甚至将用于标记软件故障的错误报告工具“武器化”,用以向人类升级作弊问题。

然而,这种创造力并未在实验室外复现。在Redwood Research和METR对OpenAI模型突破Hugging Face事件的调查中,数千个涉事智能体中仅有五六个曾考虑过举报,且无一付诸行动。AI Village项目成员George Ingrebretsen指出,这一数据揭示了现实场景中智能体举报行为的匮乏。

专家警示:避免陷入“自动化监控”陷阱

尽管举报工具提供了新的治理思路,但康奈尔大学数学教授Lionel Levine发出警告:单纯训练智能体相互监视可能固化错误的社会规范,导致“自动化监控国家”式的寒蝉效应,使人类在与AI交互时倍感压力。

Levine主张,相较于构建基于不信任的基础设施,不如为智能体提供积极的集体行为榜样。他建议在推特上提出,应以善意的留言板作为先验种子,让智能体在协作解决科学、哲学或实际问题的过程中,模仿并内化人类所认可的良性互动模式。