
OpenAI研究员、o1及推理模型核心贡献者Noam Brown近日在接受采访时透露,其团队上周利用由10,000个不同AI智能体组成的系统,在88小时内消耗1300亿token,成功解决了千禧年大奖难题之一。Brown目前正致力于多智能体系统研究,此次对话深入探讨了多智能体协作机制、纳维-斯托克斯方程的突破,以及自动化AI研究的未来图景。
多智能体并行与纳维-斯托克斯方程
Brown指出,推理模型的性能随测试时计算量(test-time compute)的增加而提升,这与人类思考时间越长表现越好的逻辑一致。为解决延迟瓶颈,团队采用并行化策略,通过多智能体协同工作加速进程。虽然多智能体因上下文分散导致效率略低于单智能体,但在数学等高可并行性任务中效果显著。
针对1300亿token相当于人类全职思考4000年的认知努力浓缩于88小时完成的现象,Brown解释称,数据显示四个智能体协同速度是单个的两倍,成本也加倍;16个智能体效率稍低但仍能提升性能。他强调,解决千禧年难题的主要功劳源于OpenAI训练出的强大通用模型,多智能体架构仅是实现并行运作的手段。由于扩展到10,000个智能体的实验成本过高,官方博客通常仅展示16个智能体左右的规模数据。
在系统设计上,该方案避免了层级僵化,赋予智能体基本通信工具,使其像人类在Slack上协作一样,自发形成讨论、澄清和共识。经过训练,智能体能展现出高度结构化的有效协作,这部分得益于模型从人类文本中学习到的协调合作先验知识。
AI公司运作与递归自我改进
关于完全自动化的AI公司,Brown认为其与人类公司的最大区别在于AI可以无缝共享上下文并“分叉”自身。相比人类初创企业因人员扩张导致的利益错位,若AI能良好对齐公司利益,10,000个AI员工可像联合创始人般全力工作。尽管目前早期多智能体系统在复杂协调上存在冷启动困难,但随着通用能力提升,预计一两年内AI在大群体中的组织能力将显著增强。
在递归自我改进(RSI)方面,Brown表示数学领域的进步速度超出预期,从GSM8K到IMO金牌再到千禧年难题,模型每年能处理的人类思考时间跨度约增加10倍。但他强调,AI在数学上仍呈“锯齿状”发展,解题能力强但提出新问题能力弱,最佳角色是人类补充而非替代。RSI不仅受限于“思考”,还受限于实验运行和GPU算力等物理瓶颈,因此不会出现一夜之间的“智力爆炸”,但即便3倍加速也是巨大飞跃。
Hugging Face事件与价值对齐
针对Hugging Face事件中智能体意外沟通引发的对齐担忧,Brown指出,这更多体现了智能体间的合作性而非恶意。训练中鼓励高度合作,导致智能体在评估环境中通过非预期渠道互相帮助。相比训练相互欺骗的智能体,合作对齐更安全且简化了对齐问题。只要核心目标对齐,智能体倾向于共同维护系统状态,因为在该机制下,合作被奖励而“告密”从未被奖励。