Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

Agent 榜的评测方式和其他榜单不太一样:它不是靠单次问答的双盲投票,而是基于数百万次真实 Agent 模式会话,综合任务是否被用户确认完成、能否根据用户反馈及时调整、工具调用失败后能否自我纠正,以及是否会"幻觉式"调用不存在的工具等多项信号统计得出,反映模型在真实多步骤任务中调度工具、执行与自我纠错的综合表现。得分越高,代表模型在真实 Agent 使用场景下越可靠、越省心。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
模型
净改善度
净改善度:相比于基线模型,Agent 在任务解决成功率上的提升幅度
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
确认成功率
确认成功率:Agent 成功执行任务并得到系统校验与最终确认的比例
好评/差评比
好评/差评比:用户反馈中肯定评价与否定评价的比例
可控性
可控性:Agent 在长上下文中精准遵循复杂系统提示词与约束指令的能力
Bash 恢复率
Bash 恢复率:当终端命令执行出错时,Agent 自主分析、重新尝试并纠正错误的成功概率
工具幻觉率
工具幻觉率:Agent 在调用 API/工具时,生成虚假工具名称或错误/不存在参数的比例
评测场次
评测场次:用于评估 Agent 表现的测试任务或运行会话总量
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
开发厂商
1
Anthropic
Claude Opus 5 (High)AnthropicProprietary
12.19%±1.45
+1.45 / -1.4515.35%±3.03%19.26%±5.29%11.34%±2.79%13.89%±0.79%1.13%±0.19%19,739$5 / $25Anthropic
2
Anthropic
Claude Fable 5 (High)AnthropicProprietary
12.01%±2.57
+2.57 / -2.5710.66%±4.90%25.14%±9.01%8.84%±5.23%14.19%±3.71%1.22%±0.19%24,417$10 / $50Anthropic
3
Anthropic
Claude Opus 5 (Max)AnthropicProprietary
11.95%±1.71
+1.71 / -1.7117.96%±3.18%19.30%±6.26%6.95%±3.43%14.38%±0.88%1.18%±0.19%15,515$5 / $25Anthropic
4
OpenAI
GPT 5.6 Sol (xHigh)OpenAIProprietary
10.86%±1.8
+1.8 / -1.810.12%±3.69%23.03%±6.72%9.23%±3.74%10.71%±1.27%1.22%±0.19%18,091$5 / $30OpenAI
5
Moonshot
Kimi K3 (Max)MoonshotOpen
10.60%±1.04
+1.04 / -1.0415.55%±2.06%20.31%±3.78%7.80%±1.91%8.12%±0.83%1.22%±0.19%28,369$3 / $15Moonshot
6
Anthropic
Claude Opus 4.8 (High)AnthropicProprietary
9.78%±1.78
+1.78 / -1.789.45%±3.10%22.52%±5.71%8.44%±3.33%9.29%±2.89%0.80%±2.47%35,151$5 / $25Anthropic
7
OpenAI
GPT 5.5 (xHigh)OpenAIProprietary
8.90%±1.03
+1.03 / -1.034.97%±2.18%14.61%±3.62%9.17%±1.92%14.53%±1.25%1.21%±0.19%47,586$2.50 / $15OpenAI
8
Anthropic
Claude Opus 4.7 (High)AnthropicProprietary
8.17%±1.43
+1.43 / -1.436.61%±2.95%12.32%±4.81%7.72%±2.91%13.09%±2.08%1.12%±0.21%36,116$5 / $25Anthropic
9
OpenAI
GPT 5.5 (High)OpenAIProprietary
7.73%±0.97
+0.97 / -0.974.03%±2.04%11.62%±3.39%8.59%±1.79%13.21%±0.97%1.22%±0.19%72,849$2.50 / $15OpenAI
10
Anthropic
Claude Opus 4.7AnthropicProprietary
7.66%±1.45
+1.45 / -1.455.45%±3.08%11.57%±4.71%9.95%±2.87%10.15%±2.31%1.17%±0.19%36,677$5 / $25Anthropic
11
Alibaba
Qwen3.8 MaxAlibabaProprietary
7.61%±1.6
+1.6 / -1.612.54%±3.32%11.64%±5.58%5.34%±3.09%8.40%±1.21%0.11%±0.41%9,314$2 / $6Alibaba
12
Anthropic
Claude Sonnet 5 (High)AnthropicProprietary
7.14%±2.29
+2.29 / -2.293.13%±4.73%15.08%±7.93%5.22%±4.88%11.21%±1.80%1.07%±0.20%25,733$1 / $5Anthropic
13
Anthropic
Claude Opus 4.6AnthropicProprietary
6.89%±1.39
+1.39 / -1.395.28%±2.98%8.21%±4.53%8.30%±2.73%11.46%±1.80%1.22%±0.19%35,853$5 / $25Anthropic
14
Z.ai
GLM 5.2 (Max)Z.aiOpen
6.74%±0.9
+0.9 / -0.98.39%±1.91%11.60%±3.18%6.14%±1.58%6.33%±1.07%1.22%±0.19%53,469$1.40 / $4.40Z.ai
15
OpenAI
GPT 5.5OpenAIProprietary
6.35%±0.91
+0.91 / -0.913.63%±1.98%7.71%±3.12%7.36%±1.72%11.86%±1.00%1.22%±0.19%73,997$2.50 / $15OpenAI
16
SpaceXAI
Grok 4.5SpaceXAIProprietary
6.19%±1.2
+1.2 / -1.26.42%±2.68%5.04%±4.27%7.04%±2.29%11.22%±1.20%1.22%±0.19%29,943$2 / $6SpaceXAI
17
OpenAI
GPT 5.4 (High)OpenAIProprietary
4.99%±0.95
+0.95 / -0.954.33%±2.06%3.82%±3.18%6.05%±1.81%9.55%±1.32%1.22%±0.19%73,220$2.50 / $15OpenAI
18
OpenAI
GPT 5.6 Luna (xHigh)OpenAIProprietary
4.28%±1.88
+1.88 / -1.881.09%±4.27%8.16%±6.50%1.48%±3.85%11.65%±1.45%1.22%±0.19%8,692$1 / $6OpenAI
19
DeepSeek
Deepseek V4 Flash (High) (20260731)DeepSeekOpen
4.04%±0.81
+0.81 / -0.818.70%±1.93%2.46%±2.71%3.34%±1.57%4.48%±0.69%1.21%±0.19%36,264N/ADeepSeek
20
OpenAI
GPT 5.6 Terra (xHigh)OpenAIProprietary
3.78%±1.25
+1.25 / -1.251.80%±3.04%3.56%±4.22%6.22%±2.43%9.70%±1.15%1.22%±0.19%14,022$2.50 / $15OpenAI
21
Google
Gemini 3.7 Flash (High)GoogleProprietary
3.61%±1.22
+1.22 / -1.229.85%±2.83%1.84%±4.04%2.83%±2.51%2.33%±1.39%1.18%±0.19%13,000$0.75 / $3.57Google
22
Anthropic
Claude Sonnet 4.6AnthropicProprietary
3.12%±1.4
+1.4 / -1.40.06%±3.15%1.07%±4.17%2.21%±2.70%11.15%±2.72%1.09%±0.24%36,710$1.50 / $7.50Anthropic
23
Anthropic
Claude Opus 4.8AnthropicProprietary
2.12%±2.72
+2.72 / -2.728.76%±3.17%13.67%±5.40%8.34%±3.22%10.86%±2.23%31.01%±10.90%33,192$5 / $25Anthropic
24
Meta
Muse Spark 1.1MetaProprietary
1.17%±0.61
+0.61 / -0.617.28%±1.40%4.95%±1.82%3.25%±1.15%5.59%±1.20%1.19%±0.19%72,668$1.25 / $4.25Meta
25
Moonshot
Kimi K2.7 CodeMoonshotOpen
1.08%±2.15
+2.15 / -2.154.43%±4.55%2.74%±7.27%1.76%±4.86%1.22%±2.58%1.22%±0.19%11,029$0.47 / $2Moonshot
显示第 125 条,共 49 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。

常见问题解答 (FAQ)

Arena 的智能体模式(Agent Mode)会将每一次真实的会话路由给一个随机选择的模型,并观察该模型实际执行任务的表现。当前的智能体排行榜根据模型在数百万次真实的、野外的智能体模式交互中作为“协调器(Orchestrator)”(即决定调用哪些工具,如 bash、网页搜索、获取页面、写入文件等的主模型)的表现进行排名。

与让用户在两个并排的回答中投票不同,智能体模式收集单线程的用户反馈,并根据模型在执行真实任务期间的实际表现进行评分。

大多数 Arena 排行榜都是基于成对的人类投票:您看到两个匿名的回答并选择较好的那个,评分来自这些两两对决。智能体排行榜在以下三个方面有所不同:

  • 采用单线程轨迹,而非对决: 在智能体模式下,用户在长生命周期的线程中与单个智能体进行交互,有时长达数百个回合。而在以前,用户在对决中同时与两个模型交互。
  • 结合显式反馈与隐式信号,而非仅依赖显式反馈: 以前我们使用投票(一种明确表达的显式反馈)来计算排行榜。现在,Agent Arena 会测量多种隐式行为信号,例如自然语言的赞扬与抱怨、工具幻觉等,以计算出超越单纯显式反馈的综合排行榜。
  • 采用名为“因果追踪 (Causal Tracing)”的新方法,而非 Bradley-Terry 回归: 我们之前的排行榜都使用 Bradley-Terry 回归来计算模型得分。在智能体模式中,我们引入了“因果追踪”方法,即从交互轨迹中挖掘信号,然后利用因果推断技术来计算智能体不同子组件的干预效应(Treatment Effects)。最终的排行榜报告的是使用特定模型相比于平均模型的因果效应。

由于智能体模式将每个会话随机分配给不同的模型,我们可以通过观察模型行为来推断其因果干预效应。对于每个信号,我们计算每个模型的得分,并将其表示为与代表平均模型的随机基线相比的百分点差异。这种针对每个模型、每个信号的对比即为净改善度 (Net Improvement):即换用特定模型后,某种行为改善或恶化的程度。正值表示高于平均水平,负值表示低于平均水平。需要注意的是,随着平均模型越来越强,基准线也会随之提高,因此任何特定模型的净改善度可能会下降。这意味着排行榜是实时动态的,反映了模型相对于所有实验室最新旗舰模型的表现。

主排名是模型在所有信号上的净改善度的加权平均值,因此每个信号都拥有一票。目前,这个平均值是等权重的,但我们未来可能会做出调整。我们还显示了每个数字的 95% 置信区间,这样您就可以看出两个模型是真的存在实力差距,还是过于接近以至于无法断定输赢。

“好”和“坏”是根据每个信号自身的天然方向定义的。对于某些信号,数值越高越好(例如成功执行的修正、确认的成功);而对于另一些信号,数值越低越好(例如较少的工具幻觉)。排行榜始终对数值进行定向和配色,使得绿色始终代表表现良好,无需用户自行换算。

要深入了解我们如何挖掘轨迹和计算干预效应,请参阅官方的 方法论撰写 (Methodology Write-up)

排行榜上的每个分数都是一个干预效应(Treatment Effect),表示如果用特定协调器替换平均协调器,在各个信号上所能获得的改善。绿色高亮表示该模型优于典型模型,红色高亮表示劣于典型模型,接近零的分数表示处于平均水平。因此,7% 表示明显高于平均水平,而 -3% 表示略低于平均水平。

每个模型旁边的粗体大字是其综合评分:它在每个信号上的百分比平均值。每个信号列显示了该模型在这一特定行为上的百分比,便于您发现模型的优势与劣势。

数字后面的小“±”是 95% 置信区间,表示基于目前收集的数据我们的把握程度。例如,5% ± 2% 的得分实际意味着“大约在 3% 到 7% 之间”。当两个模型的范围重叠较多时,应将它们视为基本持平,而不要过分纠结于具体名次。

需要记住的一点是:对于少数信号,数值越低反而是越好的结果(例如减少调用不存在的幻觉工具)。排行榜始终将好的一向着色为绿色,因此您可以直接将绿色理解为“表现良好”,而无需在脑海中进行数学换算。

信号是从真实会话轨迹中评分的单个独立、可测量的行为。每个信号都捕获了做好工作的不同维度,主分数是所有这些信号的等权平均值。当前的信号包括:

  • 确认成功率 (Confirmed Success): 用户显式确认任务完成的频率。基于交互轨迹中最终的显式任务批准/不批准而构建。数值越高越好。
  • 好评/差评比 (Praise vs Complaint): 在任务中,用户表达的显式积极内容是否多于消极内容。这隔离了实际工作过程中用户的自然语言满意度,独立于按钮点击。数值越高越好。
  • 可控性 (Steerability): 当用户提出异议或纠正模型时,模型的紧接着的下一次回复是否能够真正落实(接受、延伸或重定向),而不是被拒绝或毫无进展。数值越高越好。
  • Bash 恢复率 (Bash Recovery): 当命令由于模型自身的错误而执行失败后,模型需要尝试多少次重试才能恢复到正常工作的命令。数值越高越好。
  • 工具幻觉率 (Tool Hallucination): 模型调用不存在的工具(虚构的工具名称、格式错误的垃圾信息,或混入工具字段的杂乱推理文本)的频率。数值越低越好。

会的。排行榜是一个动态的测量系统,而不是一次性的静态评分。它随着新的真实智能体模式会话的接入而刷新,因此随着我们收集到更多关于模型行为的证据,模型的分数可能会发生变动。您随时可以查看“上次更新”的日期以及当前排行榜背后的观测数据量。

当新模型加入时,排名也可能会发生移动。每个分数都是相对于平均模型进行测量的,因此加入一个强大的新模型会抬高其他人比较的门槛,而加入一个较弱的模型则会降低门槛。这意味着即使模型自身行为没有发生改变,它的分数也可能会因为竞争对手的变化而出现微调。这就像有更聪明的对手加入时,国际象棋比赛会变得更难一样:您的棋艺没有变,但对手的水平变了。

随着更多会话的积累,误差范围也会缩小,模型之间微小的实力差距随着时间的推移会变得更加清晰。

是的。当前的集合只是一个起点,评估框架在设计上是可扩展的。我们已经追踪了几个尚未计入主评分的附加行为(例如清洁延续、不批准、会话内重试和工具错误率),并计划在每个新信号得到验证后,逐步将它们纳入进来以丰富评估体系。