
Google DeepMind 推出 Gemini 4 Argon,这是其七个多月来首款超越 Flash 系列的自有模型。得益于更低的幻觉率和更强的代理(Agentic)能力,该模型在 Artificial Analysis 智能指数中获得 53 分,与 GPT-6 Astra 持平,并领先 GPT-6.1 Sol 1 分,标志着 Google 重回全球智能水平前三大实验室行列。
性能与成本优势
在当前的促销活动中,Gemini 4 Argon 享受 50% 的价格折扣,且缓存折扣提升至 95%。在此定价下,完成一个智能指数任务的成本为 1.99 美元,仅为同等智能水平 GPT-6 Astra(3.26 美元)的 60%。尽管其平均每个任务输出 6.2 万个代币,远高于 GPT-6 Astra 的 2.7 万个,但凭借更低的代币单价,仍实现了显著的成本效率。折扣结束后,单任务成本将回升至 3.98 美元,约为 GPT-6 Astra 的 1.2 倍。
目前,Gemini 4 Argon 正面向部分选定用户逐步开放,尚未对公众全面推出。Google 尚未确认 50% 初期促销活动的具体结束日期。
关键基准测试表现
智能水平跃升:Gemini 4 Argon(高推理模式)的 53 分成绩,较 Google 此前非 Flash 系列模型 Gemini 3.1 Pro Preview(30 分)高出 23 分,比 Gemini 3.8 Flash(高推理模式)高出 12 分。
代理能力增强:针对以往 Gemini 模型的短板,Argon 在代理评估中表现优异。在 AutomationBench-AA 测试中,它以 78% 的成绩位居第一,领先 Claude Sonnet 5.5(71%)7 个百分点。在 Terminal Bench 4 测试中,其得分 57%,较 Gemini 3.1 Pro Preview 提升 53 个百分点,仅次于 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。
极低幻觉率:在 AA-Omniscience 测试中,Gemini 4 Argon 的幻觉率仅为 15%,是所有智能指数得分 45+ 模型中最低的,远低于 GPT-6 Astra(51%)和 GPT-6.1 Sol(54%)。这表明该模型更倾向于承认未知而非错误猜测。尽管其准确性得分(50%)略低于 GPT-6 Astra(63%),但整体 AA-Omniscience 得分(42 分)与竞品基本持平。
关键模型参数
- 上下文窗口:支持 100 万代币。
- 多模态支持:支持文本、图像、视频和语音输入,输出文本。
- 定价策略:标准定价为每 100 万输入/输出代币 4 美元/20 美元;促销期内减半至 2 美元/10 美元。缓存输入代币享受 95% 折扣(折后每 100 万代币 0.10 美元),优于 Gemini 3.8 Flash 的 90%。
- 长解码延续:新增长解码延续功能,允许暂停长篇响应并在后续调用中恢复,支持生成多达 100 万个输出代币而不因超时中断。