Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

视觉多模态榜基于双盲对比投票,评测模型对图片、图表等视觉输入的理解与推理能力,具体场景包括图像描述、图表解读、文字识别(OCR)、看图辅导作业、看图创作,乃至识别图片中的幽默元素等。用户在不知晓模型身份的情况下对两份回答投票,得分经 Bradley-Terry 模型换算,越高代表模型在真实视觉理解场景下越受认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 8
Anthropic
claude-fable-5AnthropicProprietary
1315±9
+9 / -98,333$10 / $501MAnthropic
2
1 - 16
Alibaba
qwen3.8-maxAlibabaProprietary
1301±9
+9 / -95,344$2 / $61MAlibaba
3
1 - 12
Anthropic
claude-opus-4-7-highAnthropicProprietary
1301±7
+7 / -720,461$5 / $251MAnthropic
4
1 - 13
Anthropic
claude-opus-4-6-highAnthropicProprietary
1300±7
+7 / -720,310$5 / $251MAnthropic
5
1 - 17
Anthropic
claude-opus-4-7AnthropicProprietary
1299±7
+7 / -720,857$5 / $251MAnthropic
6
1 - 23
Anthropic
claude-opus-5-highAnthropicProprietary
1297±11
+11 / -113,821$5 / $251MAnthropic
7
1 - 29
Google
gemini-3.6-flash-highGoogleProprietary
1295±18
+18 / -181,205$0.38 / $1.881MGoogle
8
2 - 24
Meta
muse-sparkMetaProprietary
1294±9
+9 / -95,576N/AN/AMeta
9
2 - 23
Anthropic
claude-opus-4-6AnthropicProprietary
1293±7
+7 / -724,609$5 / $251MAnthropic
10
1 - 30
Meta
muse-spark-1.2 (xHigh)MetaProprietary
1290±18
+18 / -181,282$1.25 / $4.25N/AMeta
11
2 - 28
Google
gemini-3-proGoogleProprietary
1289±8
+8 / -813,095$2 / $121MGoogle
12
4 - 28
OpenAI
gpt-5.5OpenAIProprietary
1286±7
+7 / -718,722$2.50 / $151.1MOpenAI
13
2 - 30
SpaceXAI
grok-4.5SpaceXAIProprietary
1285±11
+11 / -113,871$2 / $6500KSpaceXAI
14
4 - 30
Anthropic
claude-opus-4-8-highAnthropicProprietary
1284±8
+8 / -811,131$5 / $251MAnthropic
15
3 - 30
Google
gemini-3.5-flash-mediumGoogleProprietary
1284±10
+10 / -105,616$0.75 / $4.501MGoogle
16
6 - 30
OpenAI
gpt-5.5-highOpenAIProprietary
1283±7
+7 / -717,520$2.50 / $151.1MOpenAI
17
4 - 30
Google
gemini-3.5-flash-highGoogleProprietary
1283±10
+10 / -105,762$0.75 / $4.501MGoogle
18
6 - 30
OpenAI
gpt-5.4-highOpenAIProprietary
1283±7
+7 / -720,607$1.25 / $7.501.1MOpenAI
19
5 - 30
Meta
muse-spark-1.1MetaProprietary
1282±10
+10 / -104,661$1.25 / $4.251MMeta
20
6 - 30
OpenAI
gpt-5.4OpenAIProprietary
1280±7
+7 / -720,516$1.25 / $7.501.1MOpenAI
21
6 - 30
Anthropic
claude-opus-4-8AnthropicProprietary
1280±8
+8 / -811,571$5 / $251MAnthropic
22
6 - 32
OpenAI
gpt-5.6-sol-xhighOpenAIProprietary
1280±11
+11 / -113,353$5 / $30N/AOpenAI
23
8 - 30
OpenAI
gpt-5.2-chat-latest-20260210OpenAIProprietary
1278±7
+7 / -715,373$1.75 / $14128KOpenAI
24
6 - 32
OpenAI
gpt-5.5-instantOpenAIProprietary
1278±9
+9 / -97,224$2.50 / $151.1MOpenAI
25
9 - 30
Google
gemini-3.1-pro-previewGoogleProprietary
1277±6
+6 / -636,893$1 / $61MGoogle
显示第 125 条,共 145 条记录
每页显示:
1 / 6

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。