
AI行业正呈现双重竞赛态势:研究人员竞相提升智能水平,投资者则加速为AI未来定价。本周,Reflection与Mistral发布新模型,TypeSafe完成巨额融资,Arena推出对齐指数。这些动态表明,市场野心已超越构建更好的聊天机器人,转向更深层的能力验证与基础设施搭建。
大模型新动向:效率、主权与数学验证
Reflection推出Beam,这是一款拥有5010亿参数的混合专家(MoE)模型,每token激活230亿参数。该模型聚焦强化学习与推理效率,Reflection称其生成了超1亿次训练rollout,以低于竞争对手的估算推理算力实现了具备竞争力的性能。需注意,这些估算非实际部署成本,且模型权重承诺于本月晚些时候发布。这一进展意味着,执行长工作流的智能体将拥有更可控的“运营预算”。
Mistral发布了万亿参数多模态模型Mistral Large 4(绰号“Le Chonk”)的公共API预览版,权重计划于本月底发布。该模型在3800块NVIDIA Grace Blackwell GPU上训练,活跃参数为490亿。Mistral强调其在编码、网络安全、金融及法律领域的优势,并依托欧洲基础设施训练。随着主权成为产品特性,企业选择模型不仅关乎性能,更涉及对部署、定制及访问权限的控制。
OpenAI则从基础科学层面拓展智能边界,发布了由未发布内部模型生成的722篇数学手稿,涵盖约20个子领域。尽管部分结果已通过Lean形式化验证,但验证工作尚未完成,且已有3篇因符号错误被撤回、14篇被修订。由于模型未公开,外部无法复现结果。这一举动引发关注:AI可能加速研究进程,但也使检查、解释和连接结果成为新瓶颈,信任问题从企业工作流延伸至科学基础层面。
资本热潮:高估值背后的架构押注
TypeSafe以75亿美元估值完成8.7亿美元A轮融资,由Andreessen Horowitz领投。其Jev模型能产生带置信度估计的类型化决策,供软件直接消费。该估值押注于业务流程中成千上万小判断(如分类请求、选择工具)形成的专用智能市场。尽管工程前景诱人,但商业成果仍需时间证明。
AI排行榜平台Arena以31亿美元估值完成2亿美元B轮融资,Lightspeed和Khosla领投。其估值较今年1月A轮时的17亿美元几近翻倍,6月年化收入达1亿美元。除融资外,Arena推出“对齐指数”,评估模型的未经授权行为及虚假声明。初步排名显示OpenAI模型领先,Claude Opus 5.5位列第六。投资者正押注评判智能的机制本身将成为有价值的基础设施。
其他重要融资动态包括:GPU云提供商Lambda计划以145亿美元投前估值筹集高达40亿美元,或由Coatue和黑石领投,这或是其2027年IPO前的最后一轮私募;中国AI实验室DeepSeek接近第二轮外部融资,金额至少120亿美元,考虑扩至150亿美元,估值约750亿美元,有望2027年初科创板IPO;机器人数据初创公司Mecka AI完成6000万美元B轮融资,红杉领投;开源Hermes智能体制造商Nous Research以15亿美元估值完成9000万美元B轮融资。
此外,Manus母公司Butterfly Effect在首轮融资中筹集超5亿美元,由Boyu Capital和IDG Capital领投,此前Meta对其20亿美元的收购因监管原因取消。Manus近期推出Manus 2.0及Cue应用,赋予个人代理独立邮箱、电话及钱包。
前沿技术突破
微软亚洲研究院发布Agent Lightning v1.0,这是一个仅3500行代码的轻量级Agentic RL框架。它允许智能体直接使用部署时的工具链(如OpenHands)参与强化学习,无需在训练框架内重新实现。使用该框架,Qwen3.5-9B在SWE-bench Verified上的Pass@1指标从41.8%提升至56.4%,仅用约6000个训练样本。
NVIDIA、MIT等机构提出Long-WAM框架,扩展世界动作模型在实时机器人控制中的视觉历史。研究发现,仅当视频基础模型采用自回归预训练时,更长上下文才有效。在RoboCasa GR-1上,历史从无增至19.2秒,成功率从63.3%升至78.7%。在真实Unitree G1机器人动态堆叠杯子任务中,其成功率达95%,而竞品均失败。
普林斯顿大学等提出循环环状Transformer(RLT),将层分为并行因果编码器和循环解码器,使计算量随序列长度增长但每token成本固定。在奇偶校验任务中,RLT以100%准确率泛化至256位,远超传统Transformer。
苹果与普渡大学发现,现成MoE路由器已按Agentic操作分组专家,但标准RL忽略此结构导致路由漂移。通过添加分层路由控制及熵门控,该方法在AppWorld和AutomationBench上将成功率提高10个百分点以上。
马里兰大学与NVIDIA提出一种模型无关框架,允许冻结的LLMs和VLMs从部署经验中学习,无需改变权重。在医疗任务中,该框架将性能提升高达34.2%,且可迁移至其他领域。
NVIDIA等引入Hebero,一个基于GPU并行的异构多任务强化学习框架。其IW-ABC方法利用任务进度放宽行为克隆,在40个异构操作任务中,从视觉输入获得93.5%的平均成功率,并在物理Piper机器人上成功执行四项任务。
行业动态速览
- Anthropic发布Claude Haiku 5.5,输入代币价格降至每百万10美分,输出降至50美分,比Haiku 4.5低90%。它是首款具备可调节努力设置的Haiku模型,在OSWorld 2.1和Terminal-Bench 4.0上得分均领先于OpenAI的GPT-6 Luna。
- Google DeepMind发布EmbeddingGemma 2,这是一个7.4亿参数的Apache 2.0许可嵌入模型,可将文本、代码、图像、视频和音频映射到共享的768维空间,专为设备端搜索构建。
- Sierra与Meta联合Genesys、Shopify等合作伙伴宣布个人代理协议(Personal Agent Protocol),规定消费者个人代理如何通过OAuth会话在公司网站或API上进行身份验证和操作。v0.1规范计划于本月晚些时候发布。
- 知情人士透露,NVIDIA计划投资推理芯片初创公司d-Matrix,以使其技术与竞争对手芯片设计兼容。条款未披露。d-Matrix此前以20亿美元估值完成C轮融资,首批集成系统预计2027年第四季度推出。