OpenAI正式推出GPT-6.1 Sol,作为GPT-6 Sol的升级版本。该模型在智能代理编程、计算机操作及专业工作流中的表现几乎与旗舰模型GPT-6 Astra持平,但标准输入和输出令牌价格仅为Astra的五分之一。其缓存输入成本低至每百万令牌0.10美元,较标准输入定价降低95%,较GPT-6 Sol缓存输入定价降低50%,显著降低了开发者构建复用上下文智能体的成本。

更高性价比的任务处理能力

GPT-6.1 Sol在复杂专业任务上相比前代实现显著跃升,涵盖代码编写调试、文档理解及多步骤业务流程执行,以更低的成本逼近GPT-6 Astra的性能基准。

编码能力

在评估真实代码库复杂软件工程任务的DeepSWE v1.1基准中,GPT-6.1 Sol以约五分之一的成本达到与GPT-6 Astra相当的水平。同时,它以较低的推理成本将GPT-6 Sol的最佳得分提升了6.4个百分点。

专业工作流

在衡量模型处理含表格、图表及细节的复杂PDF文档能力的GDP.pdf测试中,GPT-6.1 Sol在低于Opus 5.5一半的单任务成本下取得了更高分数(含回退机制),并以约五分之一的成本逼近GPT-6 Astra的行业领先性能。

在评估多步骤工作流完成情况的AutomationBench中,中度推理投入下,GPT-6.1 Sol得分比Opus 5.5高出2.2个百分点,成本仅为后者的三分之一;较同设置下的GPT-6 Sol得分提升4.8个百分点。

计算机操作

在评估高难度计算机交互工作流的OSWorld 2.0离线集中,最大推理投入下,GPT-6.1 Sol得分比GPT-6 Sol高出7个百分点,成本不到一半。相较于Astra,其得分仅差2.1个百分点,但单任务成本约为后者的七分之一。

科学研究

在包含数据分析、模拟和定理证明的Terminal-Bench Science 0.1基准中,最大推理投入下,GPT-6.1 Sol将GPT-6 Sol的得分翻倍以上,单任务成本减半。其平均单任务成本为5.47美元,远低于Opus 5.5的23.21美元和Astra的23.80美元,以低75%以上的成本提供强大的科学计算能力。不过,GPT-6 Astra仍以68.1%的得分位居榜首,适用于最困难的科研任务。

事实准确性

GPT-6.1 Sol在困难提示下的事实准确性显著提升。在低推理投入阶段,包含事实错误的回答比例从11.4%降至7.7%,降幅约32%。在所有测试的推理设置中,其错误率与GPT-6 Astra的差距保持在1.9个百分点以内,而单任务成本不足后者的五分之一。

安全对齐与部署

在对齐评估中,GPT-6.1 Sol相比GPT-6 Sol有显著改进,更接近GPT-6 Astra水平。模型对局限性更透明,在尊重用户意图和安全约束方面更可靠。在涉及损坏搜索工具透明度、尊重明确限制及避免未经授权结果等挑战性评估中,其失败率低于GPT-6 Sol,且未观察到绕过自动安全审查的行为。

定价与可用性

即日起,GPT-6.1 Sol向ChatGPT Work和Codex中的Plus、Pro、Business、Enterprise及Edu用户开放,暂未在Chat中提供。开发者可通过OpenAI API调用,模型ID为gpt-6.1-sol。API标准定价为:每百万输入令牌2美元,每百万缓存输入令牌0.10美元,每百万输出令牌10美元。此外,未来几天内Codex还将上线GPT-6.1 Sol Ultrafast,令牌生成速度最高提升至标准版的8倍。