
据媒体报道,Mistral AI正式发布Mistral Large 4(简称ML4,官方昵称“le Chonk”)公开预览版。这款拥有1万亿参数、490亿激活参数的原生多模态模型,被官方称为迄今最大且能力最强的模型。目前,开发者可通过Mistral Studio试用预览版API,模型权重预计将于本月底正式开源。
性能对标全球顶尖闭源模型
ML4在编码、智能体工作流及多模态理解方面表现卓越,综合性能已与全球最强开源模型持平,并显著优于欧美开发的任何其他开源权重模型。在视觉定位等特定领域,ML4甚至超越了部分领先的前沿闭源模型。在网络安全、金融和法律等企业关键负载场景中,该模型展现出开源阵营的顶尖水平。
在权重正式发布前,Mistral正联合网络安全专家、审核合作伙伴及国家当局进行真实环境下的红队测试。合作方将以降低审查限制的方式访问模型,以扩展其网络防御能力。
核心能力深度解析
网络安全:开源阵营最强
在Artificial Analysis网络安全指数中,ML4位列全球前五,大幅领先于中国以外开发的开源模型。在复现并修补开源软件真实漏洞的测试中,ML4得分82%,居所有模型之首;在Cybench安全竞赛基准测试中,其解决了93%的挑战,创下开源模型最高分纪录。
相比之下,包括Claude Opus 5.5和GPT-6 Astra在内的多款领先闭源模型因安全过滤器拒绝执行此类任务,得分接近零。ML4则能胜任恶意软件分析、漏洞优先级排序及检测规则编写,支持私有云或本地部署,满足主权可控及可审计的安全运营需求。
智能体编码与工作流
在软件工程与复杂终端工作流方面,ML4表现强劲。其综合编码智能体指数得分为49.8%,超越DeepSeek V4 Pro 0813和Qwen3.8 Max。在Surge AI进行的盲测人工评估中,ML4预览版以3.74分位居第二,仅次于Claude Opus 5,高于Kimi K3及GLM系列模型。
在通用智能体工作流方面,ML4在涵盖Gmail、Salesforce等应用的AutomationBench测试中得分59.9%,领先Kimi K3及DeepSeek V4 Pro。在评估长周期知识工作的AA-Briefcase基准测试中,其Elo分数达到1,393分,同样优于DeepSeek V4 Pro。
多模态与科学推理
ML4在多模态理解上实现飞跃,尤其在视觉定位(Visual Grounding)方面表现突出。在Dense 200测试中,ML4以42%的得分超越GPT-6-Astra(41%)。该模型能够处理吉像素级卫星图像、验证工程图纸机械部件,并从PDF中提取证据,适用于灾害响应、制造及地球观测等领域。
在科学与数学领域,ML4结合AI方法与专家知识,在SciCode-Verified基准测试中领跑开源模型。它能一次性生成复杂的海特里克-福克(Hartree–Fock)化学模拟,并在形式推理及应用数学任务中表现出比GLM-5.3更精准的结构化推理能力。
知识工作与安全性
针对法律与金融等专业场景,第三方机构vals.ai评估显示,ML4在代表性任务上的表现超越了GPT-6-Astra。在HarveyAI法律智能体基准测试中,其表现优于所有开源模型。在财务分析演示中,ML4能有效处理跨国企业融资挑战,从EDGAR等数据库检索并综合信息。
安全性方面,ML4在间接提示注入鲁棒性基准测试中取得饱和成绩。在Lakera B3 AI安全基准测试中,其抵御了93.3%的攻击,未见更高分数的竞争对手。尽管在网络安全测试中表现激进,但在JailbreakBench等恶意请求测试中,ML4的平均拒绝率高于其他所有开源模型,显示出更强的责任感。
强化学习与未来展望
ML4的训练依托于大规模强化学习(RL)基础设施。在3000张GPU集群支持下,单次训练运行每天产生约330亿tokens,其中约160亿为可训练完成tokens。这种基于模型自身尝试结果的训练方式,使得模型性能随任务难度提升而持续进化,未出现饱和迹象。
Mistral表示,ML4是其30亿欧元D轮融资路线图上的首个里程碑,这也是欧洲科技公司有史以来最大的股权融资。目前,这笔资金已投入用于扩大欧洲数据中心计算能力。随着基础设施扩展及训练规模增加,预计未来几周至几个月内,模型性能将迎来快速提升。本月底,Mistral将发布模型权重及更多架构细节。