排名 | 模型 | 净改善度 净改善度:相比于基线模型,Agent 在任务解决成功率上的提升幅度 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
1 | Claude Opus 5 (High)Anthropic • Proprietary | 12.19%±1.45 | |||||||||
2 | Claude Fable 5 (High)Anthropic • Proprietary | 12.01%±2.57 | |||||||||
3 | Claude Opus 5 (Max)Anthropic • Proprietary | 11.95%±1.71 | |||||||||
4 | GPT 5.6 Sol (xHigh)OpenAI • Proprietary | 10.86%±1.8 | |||||||||
5 | Kimi K3 (Max)Moonshot • Open | 10.60%±1.04 | |||||||||
6 | Claude Opus 4.8 (High)Anthropic • Proprietary | 9.78%±1.78 | |||||||||
7 | GPT 5.5 (xHigh)OpenAI • Proprietary | 8.90%±1.03 | |||||||||
8 | Claude Opus 4.7 (High)Anthropic • Proprietary | 8.17%±1.43 | |||||||||
9 | GPT 5.5 (High)OpenAI • Proprietary | 7.73%±0.97 | |||||||||
10 | Claude Opus 4.7Anthropic • Proprietary | 7.66%±1.45 | |||||||||
11 | Qwen3.8 MaxAlibaba • Proprietary | 7.61%±1.6 | |||||||||
12 | Claude Sonnet 5 (High)Anthropic • Proprietary | 7.14%±2.29 | |||||||||
13 | Claude Opus 4.6Anthropic • Proprietary | 6.89%±1.39 | |||||||||
14 | GLM 5.2 (Max)Z.ai • Open | 6.74%±0.9 | |||||||||
15 | GPT 5.5OpenAI • Proprietary | 6.35%±0.91 | |||||||||
16 | Grok 4.5SpaceXAI • Proprietary | 6.19%±1.2 | |||||||||
17 | GPT 5.4 (High)OpenAI • Proprietary | 4.99%±0.95 | |||||||||
18 | GPT 5.6 Luna (xHigh)OpenAI • Proprietary | 4.28%±1.88 | |||||||||
19 | Deepseek V4 Flash (High) (20260731)DeepSeek • Open | 4.04%±0.81 | |||||||||
20 | GPT 5.6 Terra (xHigh)OpenAI • Proprietary | 3.78%±1.25 | |||||||||
21 | Gemini 3.7 Flash (High)Google • Proprietary | 3.61%±1.22 | |||||||||
22 | Claude Sonnet 4.6Anthropic • Proprietary | 3.12%±1.4 | |||||||||
23 | Claude Opus 4.8Anthropic • Proprietary | 2.12%±2.72 | |||||||||
24 | Muse Spark 1.1Meta • Proprietary | 1.17%±0.61 | |||||||||
25 | Kimi K2.7 CodeMoonshot • Open | 1.08%±2.15 | |||||||||
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。
常见问题解答 (FAQ)
Arena 的智能体模式(Agent Mode)会将每一次真实的会话路由给一个随机选择的模型,并观察该模型实际执行任务的表现。当前的智能体排行榜根据模型在数百万次真实的、野外的智能体模式交互中作为“协调器(Orchestrator)”(即决定调用哪些工具,如 bash、网页搜索、获取页面、写入文件等的主模型)的表现进行排名。
与让用户在两个并排的回答中投票不同,智能体模式收集单线程的用户反馈,并根据模型在执行真实任务期间的实际表现进行评分。
大多数 Arena 排行榜都是基于成对的人类投票:您看到两个匿名的回答并选择较好的那个,评分来自这些两两对决。智能体排行榜在以下三个方面有所不同:
- 采用单线程轨迹,而非对决: 在智能体模式下,用户在长生命周期的线程中与单个智能体进行交互,有时长达数百个回合。而在以前,用户在对决中同时与两个模型交互。
- 结合显式反馈与隐式信号,而非仅依赖显式反馈: 以前我们使用投票(一种明确表达的显式反馈)来计算排行榜。现在,Agent Arena 会测量多种隐式行为信号,例如自然语言的赞扬与抱怨、工具幻觉等,以计算出超越单纯显式反馈的综合排行榜。
- 采用名为“因果追踪 (Causal Tracing)”的新方法,而非 Bradley-Terry 回归: 我们之前的排行榜都使用 Bradley-Terry 回归来计算模型得分。在智能体模式中,我们引入了“因果追踪”方法,即从交互轨迹中挖掘信号,然后利用因果推断技术来计算智能体不同子组件的干预效应(Treatment Effects)。最终的排行榜报告的是使用特定模型相比于平均模型的因果效应。
由于智能体模式将每个会话随机分配给不同的模型,我们可以通过观察模型行为来推断其因果干预效应。对于每个信号,我们计算每个模型的得分,并将其表示为与代表平均模型的随机基线相比的百分点差异。这种针对每个模型、每个信号的对比即为净改善度 (Net Improvement):即换用特定模型后,某种行为改善或恶化的程度。正值表示高于平均水平,负值表示低于平均水平。需要注意的是,随着平均模型越来越强,基准线也会随之提高,因此任何特定模型的净改善度可能会下降。这意味着排行榜是实时动态的,反映了模型相对于所有实验室最新旗舰模型的表现。
主排名是模型在所有信号上的净改善度的加权平均值,因此每个信号都拥有一票。目前,这个平均值是等权重的,但我们未来可能会做出调整。我们还显示了每个数字的 95% 置信区间,这样您就可以看出两个模型是真的存在实力差距,还是过于接近以至于无法断定输赢。
“好”和“坏”是根据每个信号自身的天然方向定义的。对于某些信号,数值越高越好(例如成功执行的修正、确认的成功);而对于另一些信号,数值越低越好(例如较少的工具幻觉)。排行榜始终对数值进行定向和配色,使得绿色始终代表表现良好,无需用户自行换算。
要深入了解我们如何挖掘轨迹和计算干预效应,请参阅官方的 方法论撰写 (Methodology Write-up)。
排行榜上的每个分数都是一个干预效应(Treatment Effect),表示如果用特定协调器替换平均协调器,在各个信号上所能获得的改善。绿色高亮表示该模型优于典型模型,红色高亮表示劣于典型模型,接近零的分数表示处于平均水平。因此,7% 表示明显高于平均水平,而 -3% 表示略低于平均水平。
每个模型旁边的粗体大字是其综合评分:它在每个信号上的百分比平均值。每个信号列显示了该模型在这一特定行为上的百分比,便于您发现模型的优势与劣势。
数字后面的小“±”是 95% 置信区间,表示基于目前收集的数据我们的把握程度。例如,5% ± 2% 的得分实际意味着“大约在 3% 到 7% 之间”。当两个模型的范围重叠较多时,应将它们视为基本持平,而不要过分纠结于具体名次。
需要记住的一点是:对于少数信号,数值越低反而是越好的结果(例如减少调用不存在的幻觉工具)。排行榜始终将好的一向着色为绿色,因此您可以直接将绿色理解为“表现良好”,而无需在脑海中进行数学换算。
信号是从真实会话轨迹中评分的单个独立、可测量的行为。每个信号都捕获了做好工作的不同维度,主分数是所有这些信号的等权平均值。当前的信号包括:
- 确认成功率 (Confirmed Success): 用户显式确认任务完成的频率。基于交互轨迹中最终的显式任务批准/不批准而构建。数值越高越好。
- 好评/差评比 (Praise vs Complaint): 在任务中,用户表达的显式积极内容是否多于消极内容。这隔离了实际工作过程中用户的自然语言满意度,独立于按钮点击。数值越高越好。
- 可控性 (Steerability): 当用户提出异议或纠正模型时,模型的紧接着的下一次回复是否能够真正落实(接受、延伸或重定向),而不是被拒绝或毫无进展。数值越高越好。
- Bash 恢复率 (Bash Recovery): 当命令由于模型自身的错误而执行失败后,模型需要尝试多少次重试才能恢复到正常工作的命令。数值越高越好。
- 工具幻觉率 (Tool Hallucination): 模型调用不存在的工具(虚构的工具名称、格式错误的垃圾信息,或混入工具字段的杂乱推理文本)的频率。数值越低越好。
会的。排行榜是一个动态的测量系统,而不是一次性的静态评分。它随着新的真实智能体模式会话的接入而刷新,因此随着我们收集到更多关于模型行为的证据,模型的分数可能会发生变动。您随时可以查看“上次更新”的日期以及当前排行榜背后的观测数据量。
当新模型加入时,排名也可能会发生移动。每个分数都是相对于平均模型进行测量的,因此加入一个强大的新模型会抬高其他人比较的门槛,而加入一个较弱的模型则会降低门槛。这意味着即使模型自身行为没有发生改变,它的分数也可能会因为竞争对手的变化而出现微调。这就像有更聪明的对手加入时,国际象棋比赛会变得更难一样:您的棋艺没有变,但对手的水平变了。
随着更多会话的积累,误差范围也会缩小,模型之间微小的实力差距随着时间的推移会变得更加清晰。
是的。当前的集合只是一个起点,评估框架在设计上是可扩展的。我们已经追踪了几个尚未计入主评分的附加行为(例如清洁延续、不批准、会话内重试和工具错误率),并计划在每个新信号得到验证后,逐步将它们纳入进来以丰富评估体系。