Arena AI 中文镜像

Agent模型排行榜

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-09-07 09:20:59
关于这份榜单

Agent 榜的评测方式和其他榜单不太一样:它不是靠单次问答的双盲投票,而是基于数百万次真实 Agent 模式会话,综合任务是否被用户确认完成、能否根据用户反馈及时调整、工具调用失败后能否自我纠正,以及是否会"幻觉式"调用不存在的工具等多项信号统计得出,反映模型在真实多步骤任务中调度工具、执行与自我纠错的综合表现。得分越高,代表模型在真实 Agent 使用场景下越可靠、越省心。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-09-07 09:20:59
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
净改善度
净改善度:相比于基线模型,Agent 在任务解决成功率上的提升幅度。数字右下角的小字(例如 ±1.71%)是 95% 置信区间,数值范围越窄说明这个结果的把握越大
确认成功
确认成功:Agent 成功执行任务并通过系统校验的表现,相对平均模型的改善幅度。正值表示优于平均模型,负值表示低于平均模型
好评/差评
好评/差评:用户反馈中肯定与否定评价的对比,相对平均模型的改善幅度。正值表示优于平均模型,负值表示低于平均模型
可控性
可控性:Agent 遵循复杂系统提示词与约束指令的表现,相对平均模型的改善幅度。正值表示优于平均模型,负值表示低于平均模型
Bash 恢复
Bash 恢复:终端命令出错后,Agent 自主分析并纠正错误的表现,相对平均模型的改善幅度。正值表示优于平均模型,负值表示低于平均模型
工具幻觉
工具幻觉:Agent 调用不存在的工具或错误参数的情况,相对平均模型的改善幅度。这一项数值越低越好,所以正值表示幻觉少于平均模型,负值表示多于平均模型
评测场次
评测场次:用于评估 Agent 表现的测试任务或运行会话总量
单任务成本 (P50)
单任务成本 (P50):基于过去 14 天真实 Agent Mode 任务实测得出的单次任务花费中位数,而非官方标价
输出 Token 数 (P50)
输出 Token 数 (P50):基于过去 14 天真实 Agent Mode 任务实测得出的单次任务输出 Token 数中位数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
开发厂商
1
1 - 3
USAnthropicClaude Fable 5.1 (Max)
+15.87%±2.84%
22.45%±3.71%42.45%±10.94%0.58%±6.77%13.11%±1.33%0.78%±0.13%6796$4.1952K$10 / $50Anthropic
2
1 - 4
USAnthropicClaude Opus 5 (High)
+12.68%±1.73%
13.30%±3.69%18.27%±6.49%16.09%±3.24%15.03%±0.84%0.73%±0.13%2,2594$2.4031K$5 / $25Anthropic
3
1 - 6
USAnthropicClaude Opus 5 (Max)
+11.67%±1.96%
14.89%±3.95%17.30%±7.10%9.70%±3.85%15.69%±0.82%0.76%±0.13%1,8112$3.7551.1K$5 / $25Anthropic
4
2 - 7
USAnthropicClaude Fable 5 (High)
+10.23%±1.46%
7.37%±3.17%19.36%±5.29%11.89%±2.68%11.73%±1.72%0.78%±0.13%3,6204$2.3616K$10 / $50Anthropic
5
3 - 10
USOpenAIGPT 5.6 Sol (xHigh)
+9.31%±1.49%
6.68%±3.13%22.07%±5.50%8.88%±2.84%8.14%±0.96%0.78%±0.13%2,9730$1.2018.5K$4 / $20OpenAI
6
3 - 10
USAnthropicClaude Opus 4.8 (High)
+9.17%±1.48%
5.27%±3.07%18.04%±5.19%12.59%±2.73%10.17%±1.68%-0.24%±0.81%3,8148$1.6017.3K$5 / $25Anthropic
7
5 - 12
CNMoonshotKimi K3 (Max)
+7.96%±0.68%
16.58%±1.40%14.03%±2.36%1.24%±1.35%7.16%±0.58%0.78%±0.13%9,7915$0.8125K$3 / $15Moonshot
8
4 - 20
USAnthropicClaude Sonnet 5 (High)
+7.41%±1.95%
2.80%±4.13%11.19%±6.78%11.52%±4.13%10.91%±1.35%0.63%±0.15%2,8662$0.8722.8K$2 / $10Anthropic
9
5 - 19
USOpenAIGPT 5.5 (xHigh)
+7.21%±1.08%
2.07%±2.42%11.41%±3.77%8.54%±2.01%13.25%±1.29%0.78%±0.13%5,1255$1.0617.4K$5 / $30OpenAI
10
5 - 20
CNTencentHy4 (Preview)
+6.92%±1.51%
13.56%±2.96%10.26%±5.61%-0.10%±3.21%10.20%±0.79%0.66%±0.14%1,4405$0.2633.8K$0.83 / $2.50Tencent
11
7 - 23
USAnthropicClaude Opus 4.7 (High)
+6.03%±1.49%
3.51%±3.15%9.92%±4.88%5.69%±2.69%10.31%±2.77%0.70%±0.14%3,6571$1.1817.8K$5 / $25Anthropic
12
8 - 21
CNZ.aiGLM 5.2 (Max)
+6.03%±0.76%
8.63%±1.64%11.73%±2.67%4.48%±1.38%4.51%±0.77%0.78%±0.13%6,9385$0.5638.5K$1.40 / $4.40Z.ai
13
8 - 23
USSpaceXAIGrok 4.5
+5.73%±1.15%
6.30%±2.55%5.07%±4.02%6.84%±2.28%9.65%±1.19%0.78%±0.13%3,5237$0.4812.8K$2 / $6SpaceXAI
14
8 - 25
USAnthropicClaude Opus 4.7
+5.66%±1.51%
2.64%±3.30%10.01%±4.88%7.27%±2.70%7.64%±2.85%0.72%±0.13%3,7121$0.768.8K$5 / $25Anthropic
15
8 - 24
USOpenAIGPT 5.5 (High)
+5.55%±1.05%
1.20%±2.23%10.27%±3.60%5.08%±1.85%10.44%±1.71%0.78%±0.13%7,3882$0.7211.2K$5 / $30OpenAI
16
8 - 24
CNAlibabaQwen 3.8 Max
+5.51%±1.09%
10.37%±2.35%6.58%±3.80%4.15%±2.19%6.72%±1.02%-0.28%±0.25%2,0691$0.4623.6K$2 / $6Alibaba
17
7 - 28
USGoogleGemini 3.8 Flash (High)
+5.47%±1.92%
10.42%±4.42%14.25%±6.25%-1.73%±4.90%3.72%±1.14%0.70%±0.15%1,0104$0.2219.3K$0.75 / $3.75Google
18
8 - 23
CNDeepSeekDeepseek V4 Pro (High)
+5.43%±0.9%
11.75%±1.91%5.24%±3.13%0.67%±1.95%8.70%±0.71%0.78%±0.13%3,4397$0.2330.4KN/ADeepSeek
19
8 - 28
USSpaceXAIGrok 4.6 (xHigh)
+4.98%±1.2%
7.83%±2.76%3.77%±4.11%3.86%±2.51%8.65%±1.00%0.78%±0.13%1,8119$1.0225.2KN/ASpaceXAI
20
9 - 29
USAnthropicClaude Opus 4.6
+4.65%±1.41%
2.50%±3.17%6.76%±4.73%4.58%±2.56%8.61%±1.86%0.78%±0.13%3,6366$0.819.3K$5 / $25Anthropic
21
11 - 28
USOpenAIGPT 5.5
+4.39%±0.9%
0.95%±2.06%5.49%±3.05%5.11%±1.63%9.61%±1.17%0.78%±0.13%7,9166$0.558.7K$5 / $30OpenAI
22
15 - 30
CNZ.aiGLM 5.3 (Max)
+3.80%±0.71%
12.10%±1.52%5.75%±2.41%0.63%±1.37%-0.28%±0.75%0.78%±0.13%5,3898$0.4526.5K$1.40 / $4.40Z.ai
23
12 - 30
CNZ.aiGLM 5.3 Flash
+3.67%±1.03%
14.14%±2.16%5.45%±3.49%0.23%±2.12%-2.24%±1.02%0.78%±0.13%1,8992$0.1131.9K$0.15 / $0.50Z.ai
24
18 - 31
CNDeepSeekDeepseek V4 Flash (High)
+3.29%±0.8%
8.46%±1.76%3.90%±2.76%0.02%±1.60%3.33%±0.65%0.76%±0.13%5,7183$0.1539.7KN/ADeepSeek
25
17 - 32
USOpenAIGPT 5.6 Terra (xHigh)
+3.04%±1.2%
-2.84%±2.98%1.41%±4.02%8.54%±2.36%7.33%±1.36%0.78%±0.13%1,7972$0.4514.1K$2 / $12OpenAI
显示第 125 条,共 59 条记录
每页显示:
1 / 3

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。

常见问题解答 (FAQ)

Arena 的智能体模式(Agent Mode)会将每一次真实的会话路由给一个随机选择的模型,并观察该模型实际执行任务的表现。当前的智能体排行榜根据模型在数百万次真实的、野外的智能体模式交互中作为“协调器(Orchestrator)”(即决定调用哪些工具,如 bash、网页搜索、获取页面、写入文件等的主模型)的表现进行排名。

与让用户在两个并排的回答中投票不同,智能体模式收集单线程的用户反馈,并根据模型在执行真实任务期间的实际表现进行评分。

大多数 Arena 排行榜都是基于成对的人类投票:您看到两个匿名的回答并选择较好的那个,评分来自这些两两对决。智能体排行榜在以下三个方面有所不同:

  • 采用单线程轨迹,而非对决: 在智能体模式下,用户在长生命周期的线程中与单个智能体进行交互,有时长达数百个回合。而在以前,用户在对决中同时与两个模型交互。
  • 结合显式反馈与隐式信号,而非仅依赖显式反馈: 以前我们使用投票(一种明确表达的显式反馈)来计算排行榜。现在,Agent Arena 会测量多种隐式行为信号,例如自然语言的赞扬与抱怨、工具幻觉等,以计算出超越单纯显式反馈的综合排行榜。
  • 采用名为“因果追踪 (Causal Tracing)”的新方法,而非 Bradley-Terry 回归: 我们之前的排行榜都使用 Bradley-Terry 回归来计算模型得分。在智能体模式中,我们引入了“因果追踪”方法,即从交互轨迹中挖掘信号,然后利用因果推断技术来计算智能体不同子组件的干预效应(Treatment Effects)。最终的排行榜报告的是使用特定模型相比于平均模型的因果效应。

由于智能体模式将每个会话随机分配给不同的模型,我们可以通过观察模型行为来推断其因果干预效应。对于每个信号,我们计算每个模型的得分,并将其表示为与代表平均模型的随机基线相比的百分点差异。这种针对每个模型、每个信号的对比即为净改善度 (Net Improvement):即换用特定模型后,某种行为改善或恶化的程度。正值表示高于平均水平,负值表示低于平均水平。需要注意的是,随着平均模型越来越强,基准线也会随之提高,因此任何特定模型的净改善度可能会下降。这意味着排行榜是实时动态的,反映了模型相对于所有实验室最新旗舰模型的表现。

主排名是模型在所有信号上的净改善度的加权平均值,因此每个信号都拥有一票。目前,这个平均值是等权重的,但我们未来可能会做出调整。我们还显示了每个数字的 95% 置信区间,这样您就可以看出两个模型是真的存在实力差距,还是过于接近以至于无法断定输赢。

“好”和“坏”是根据每个信号自身的天然方向定义的。对于某些信号,数值越高越好(例如成功执行的修正、确认的成功);而对于另一些信号,数值越低越好(例如较少的工具幻觉)。排行榜始终对数值进行定向和配色,使得绿色始终代表表现良好,无需用户自行换算。

要深入了解我们如何挖掘轨迹和计算干预效应,请参阅官方的 方法论撰写 (Methodology Write-up)

排行榜上的每个分数都是一个干预效应(Treatment Effect),表示如果用特定协调器替换平均协调器,在各个信号上所能获得的改善。绿色高亮表示该模型优于典型模型,红色高亮表示劣于典型模型,接近零的分数表示处于平均水平。因此,7% 表示明显高于平均水平,而 -3% 表示略低于平均水平。

每个模型旁边的粗体大字是其综合评分:它在每个信号上的百分比平均值。每个信号列显示了该模型在这一特定行为上的百分比,便于您发现模型的优势与劣势。

数字后面的小“±”是 95% 置信区间,表示基于目前收集的数据我们的把握程度。例如,5% ± 2% 的得分实际意味着“大约在 3% 到 7% 之间”。当两个模型的范围重叠较多时,应将它们视为基本持平,而不要过分纠结于具体名次。

需要记住的一点是:对于少数信号,数值越低反而是越好的结果(例如减少调用不存在的幻觉工具)。排行榜始终将好的一向着色为绿色,因此您可以直接将绿色理解为“表现良好”,而无需在脑海中进行数学换算。

信号是从真实会话轨迹中评分的单个独立、可测量的行为。每个信号都捕获了做好工作的不同维度,主分数是所有这些信号的等权平均值。当前的信号包括:

  • 确认成功率 (Confirmed Success): 用户显式确认任务完成的频率。基于交互轨迹中最终的显式任务批准/不批准而构建。数值越高越好。
  • 好评/差评比 (Praise vs Complaint): 在任务中,用户表达的显式积极内容是否多于消极内容。这隔离了实际工作过程中用户的自然语言满意度,独立于按钮点击。数值越高越好。
  • 可控性 (Steerability): 当用户提出异议或纠正模型时,模型的紧接着的下一次回复是否能够真正落实(接受、延伸或重定向),而不是被拒绝或毫无进展。数值越高越好。
  • Bash 恢复率 (Bash Recovery): 当命令由于模型自身的错误而执行失败后,模型需要尝试多少次重试才能恢复到正常工作的命令。数值越高越好。
  • 工具幻觉率 (Tool Hallucination): 模型调用不存在的工具(虚构的工具名称、格式错误的垃圾信息,或混入工具字段的杂乱推理文本)的频率。数值越低越好。

会的。排行榜是一个动态的测量系统,而不是一次性的静态评分。它随着新的真实智能体模式会话的接入而刷新,因此随着我们收集到更多关于模型行为的证据,模型的分数可能会发生变动。您随时可以查看“上次更新”的日期以及当前排行榜背后的观测数据量。

当新模型加入时,排名也可能会发生移动。每个分数都是相对于平均模型进行测量的,因此加入一个强大的新模型会抬高其他人比较的门槛,而加入一个较弱的模型则会降低门槛。这意味着即使模型自身行为没有发生改变,它的分数也可能会因为竞争对手的变化而出现微调。这就像有更聪明的对手加入时,国际象棋比赛会变得更难一样:您的棋艺没有变,但对手的水平变了。

随着更多会话的积累,误差范围也会缩小,模型之间微小的实力差距随着时间的推移会变得更加清晰。

是的。当前的集合只是一个起点,评估框架在设计上是可扩展的。我们已经追踪了几个尚未计入主评分的附加行为(例如清洁延续、不批准、会话内重试和工具错误率),并计划在每个新信号得到验证后,逐步将它们纳入进来以丰富评估体系。