
Google近日正式发布Android Bench 2.0,这是其评估大型语言模型(LLM)及AI代理在复杂Android开发任务中表现能力的最新基准测试版本。
与此前主要关注小规模增量代码更改的初代版本不同,Android Bench 2.0引入了“长周期任务”(Long-Horizon Tasks, LHTs)。这类任务复杂度显著提升,涵盖升级项目依赖、添加核心功能以及从零构建Android应用等场景,人类工程师通常需耗时数天甚至一周方可完成。
在评分机制上,新版基准摒弃了简单的“通过/失败”二元判定,转而采用“连续评分”体系。Google表示,这一改动能更客观地反映模型在未能完全完成任务时的实际表现水平。
基于新基准的测试数据显示,GPT-6 Astra目前以28%的通过率位居榜首,而Google自家的Gemini 3.8 Flash通过率仅为8%。参与测试的模型还包括Claude Fable 5.1、GPT-5.6 Sol和Claude Opus 5等。
Google指出,利用LHT数据集进行测试,有助于开发者更清晰地识别各模型的优劣,从而为不同难度的Android开发任务选择合适的AI工具。目前,更新后的Android Bench 2.0排行榜已正式上线,Google计划后续持续扩充更多模型的测试结果。