
Databricks已将其内部使用的GPT-6 Astra模型向全部3,500名工程师开放。在此前涉及约200名用户的试点项目中,公司对模型的编码质量及相关成本进行了评估,随后才决定将该模型推广至整个工程团队。
Databricks联合创始人兼工程副总裁Patrick Wendell在X平台表示,Astra在高度复杂的任务上明确优于公司此前最高端的模型(Opus 5、Sol 5.6),尤其是在涉及高层系统设计或长程横向任务的场景中。但他同时指出,使用Astra的工程师整体编码支出较基准线增加了约60%。在中等和低复杂度编码任务上,公司并未发现显著改进,推测现有模型在这些领域已接近性能饱和,留给Astra的提升空间有限。
预算机制引导选择性使用
试点期间,Databricks通过内部模型访问和实验层Unity Gateway运行基于队列组的测试,以在广泛部署前对新模型进行评估。正式推广后,Databricks并未将Astra设为所有任务的默认模型,而是为工程师分配了独立的Astra预算额度。
这一举措旨在鼓励工程师在复杂工作中选择性使用Astra,而在日常任务中优先选用成本较低的模型。工程师可在总体预算范围内自由组合工具与模型,并通过内部机制申请额外预算。
Astra刷新多项业界基准
GPT-6 Astra是OpenAI迄今为止在复杂推理、软件工程、计算机操作及专业工作流方面表现最佳的模型。数据显示,Astra在前沿数学研究级问题FrontierMath Tier 4上得分97.6%,在测试AI智能体探索未知环境能力的ARC-AGI-3上得分99.9%,并在网络安全基准ExploitBench上获得100%满分。
此外,在评估AI智能体在真实命令行和终端环境中执行多步工程工作的Terminal-Bench 4.0测试中,Astra得分为57.9%,远超GPT-5.6 Sol的37.3%。