中国开源人工智能生态再获突破。继推出前沿开源权重模型MiMo系列后,小米进一步开源了用于训练新模型MiMo-V2.6的强化学习(RL)环境。

该代码库托管于Hugging Face平台,包含编码、网络安全、知识工作、网页开发和音乐五个领域的7,780个任务。这些环境为AI智能体提供了执行任务、接收反馈并从结果中学习的闭环场景。

强化学习是推动推理型AI发展的核心动力,通过“试错法”训练模型:预期结果给予奖励,反之惩罚。经过反复迭代,模型能掌握更优的行动和推理模式。RL环境即为这一过程提供任务、工具及评估机制。例如在编码场景中,AI修改代码并运行测试,通过即获奖励。

MiMo RL环境中的一个典型案例重现了针对Argo Group的财务尽职调查流程。Argo Group是一家专业保险公司,2023年被布鲁克菲尔德再保险以11亿美元收购。在该模拟中,智能体扮演分析师,访问模拟业务系统(如SAP模块、CSV文件等),核对应收款项、识别法律实体汇总方式并解释数据差异。

价值数百万美元的开源资源

在代理式AI工作流落地竞赛中,RL环境价值巨大。Sarvam公司LLM研究员Harveen Singh Chadda指出,类似任务通常每个需数百至数千美元,该代码库价值 literally 高达数百万美元。

EpochAI今年早些时候的估算显示,单个RL任务成本通常在200至2,000美元之间,复杂软件工程任务可达约20,000美元。环境合同季度费用可能高达数十万甚至数百万美元,单次任务RL训练算力成本约为2,400美元。

高需求催生了专注构建RL环境的初创生态。Mercor、Surge、Handshake和Turing等传统数据标注公司开始销售RL环境,新兴公司也崭露头角。Deeptune构建职场软件高保真模拟环境,今年3月在Andreessen Horowitz领投的A轮融资中筹集4,300万美元,随后被Mercor收购。Mechanize专注于编码智能体环境,4月筹集910万美元。AfterQuery围绕API和开发者工具构建环境,4月筹集3,000万美元,在2026年融资轮次中估值达32亿美元。

对行业构建者的影响

Savante AI创始人兼RL研究员Sachin Dharashivkar表示,此举展示了前沿团队如何组织RL,中国AI团队在此方面投入大量实验且接近前沿水平。他认为,虽然开发人员将探索使用这些环境,但其更大价值在于教授构建方法。“随着RL环境开源,所有人都将在相同数据集上训练,能力将变得普及。”

Dharashivkar指出,这无助于模型公司建立差异化优势,因此RL环境构建公司仍具价值。“这对进入RL领域的公司有用,传授了最佳实践。模型公司虽可访问7,000个环境,但市场需求不会消失。”他总结称,此次发布是RL环境公司的福音,使其更清晰了解模型公司对环境质量和能力的期望。

开源主要威胁通用、可复用环境的价值。Epoch AI发现,独家环境定价是非独家环境的四到五倍,表明专有访问权限仍是商业模式关键。此外,尽管MiMo发布使RL环境获取趋于商品化,但运行这些环境所需的规模化基础设施并未商品化。例如,Prime Intellect开源其Environments Hub,同时围绕其构建包括托管训练、评估及安全沙箱在内的商业栈。