本次评测在原有基础上引入了成本与效率评估指标,并将测试框架迁移至Harbor沙盒环境。新框架支持开发者自主运行测试并提交自定义开发任务,以扩充官方测试集。目前官方已重新运行历史测试以建立新基线,旧数据将归档保留。
在最新公布的榜单中,Anthropic的Claude Fable 5凭借84.5%的准确率位居榜首,GPT 5.4与Claude Sonnet 5分列第二和第三。相比之下,谷歌自研的Gemini 3.1 Pro仅排名第五,落后于上述竞品。本次共纳入8款行业主流大模型,涵盖闭源与开源权重版本。
测试数据显示,头部模型的高准确率伴随高昂的运行成本。Fable 5与GPT 5.5在完成100道题10次运行的基准测试中,Token消耗费用均超过130美元。Gemini 3.1 Pro虽准确率稍逊,但单次测试成本控制在87美元。主打低成本的Gemini 3.5 Flash则因执行效率低下,单次运行成本高达165美元,总耗时达28小时。
随着谷歌将战略重心向智能体开发转移,安卓开发工具链的AI表现对其生态布局至关重要。为提升开发者对官方工具的依赖度,谷歌近期正探索通过收购应用源代码来扩充AI训练数据。
来源:Ars Technica