
据媒体报道,Google 最新发布的 Gemini 4 Argon 在早期独立测试中与 OpenAI 的 GPT-6 Astra 表现相当。基准测试机构 Artificial Analysis 数据显示,Argon 在“人工智能分析智能指数”中录得 53 分,与 GPT-6 Astra 持平,并领先 GPT-6.1 Sol 一分。Anthropic 的 Claude Opus 5.5 仍以 58 分位居榜首。
该分数较 Google 上一款非 Flash 系列模型 Gemini 3.1 Pro Preview 高出 23 分。基准测试机构指出,这一成绩标志着 Google 重回全球前三大 AI 实验室行列。Argon 于周三正式发布,目前仅向少数网络防御人员开放访问。
低幻觉高消耗:成本优势与性能短板并存
在衡量事实知识的 AA-Omniscience 测试中,Argon 的幻觉率为 15%,是指数得分 45 分及以上模型中最低的。相比之下,GPT-6 Astra 和 GPT-6.1 Sol 的幻觉率分别为 51% 和 54%。Google 表示,Argon 更倾向于承认未知而非盲目猜测,但其回答正确率仅为 50%,低于 GPT-6 Astra 的 63%。
在评估商业软件工作流的 AutomationBench-AA 测试中,Argon 以 78% 的成绩位列第一,领先 Claude Sonnet 5.5 七个百分点。然而,在 Terminal Bench 4 编程测试中,Argon 得分 57%,不及 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。
成本方面,使用 Launch 折扣价时,Argon 每个索引任务成本为 1.99 美元,约为 GPT-6 Astra(3.26 美元)的 60%。这种成本优势源于更低的 Token 单价,而非更少的消耗量。Argon 每任务平均输出约 62,000 个 Token,远超 GPT-6 Astra 的 27,000 个。即便如此,其单次任务成本仍是 GPT-6.1 Sol 的 2.7 倍。
Google 提供至少一个月的半价优惠:每百万输入 Token 收费 2 美元,输出 Token 收费 10 美元。若按标准价格(输入 4 美元/输出 20 美元)计算,单任务成本将升至 3.98 美元,约为 GPT-6 Astra 的 1.2 倍。Google 尚未公布折扣结束的具体时间。
登顶 Arena 榜单,内部却现质疑声
在由用户投票决定的 Text Arena 排行榜上,Argon 以 1,525 分领先 Claude Opus 4.6 二十分,位居榜首。其在 WebDev 排名中位列第八,并成为首个登顶 Vals 指数(得分 68.9%)的 Gemini 模型。
尽管外部数据亮眼,Google 内部对此持保留态度。据媒体报道,部分员工认为 Argon 编程能力参差不齐,前端设计表现平平。另有消息人士指出,该模型似乎受到“刷榜行为”(benchmaxxing)影响,即工程师为追求测试分数而牺牲了实际实用性。鉴于 Argon 模型体量巨大,其高昂的运行成本也引发担忧。
对于内部质疑,Google 回应称关于模型在编程等领域表现不佳的说法不准确,并引用 Google DeepMind 负责人 Koray Kavukcuoglu 的观点:“在我看来,我们始终处于前沿地位是毫无疑问的。”此前,Kavukcuoglu 曾透露希望 Gemini 4 能在年底前更早推出。继网络防御人员后,付费 API 客户和 Google AI Ultra 订阅者将成为下一批获得访问权限的用户,但 Google 尚未给出具体时间表。