Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

文档理解榜聚焦长文档与 PDF 场景:模型需要处理动辄数万字乃至数十万字的长文本,完成信息抽取、要点摘要、跨段落推理等任务,部分模型的上下文窗口可达 200 万 token。评测同样采用双盲对比投票,用户在不知晓模型身份的情况下对两份回答投票,得分经 Bradley-Terry 模型换算,越高代表模型在真实长文档处理场景下越受认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 4
Anthropic
claude-opus-5-highAnthropicProprietary
1520±15
+15 / -151,663$5 / $251MAnthropic
2
1 - 6
Anthropic
claude-opus-4-6AnthropicProprietary
1510±6
+6 / -637,271$5 / $251MAnthropic
3
1 - 6
Anthropic
claude-opus-4-6-highAnthropicProprietary
1506±7
+7 / -724,973$5 / $251MAnthropic
4
1 - 7
Anthropic
claude-fable-5AnthropicProprietary
1504±9
+9 / -95,792$10 / $501MAnthropic
5
2 - 9
Anthropic
claude-opus-4-7AnthropicProprietary
1498±7
+7 / -718,990$5 / $251MAnthropic
6
2 - 9
Anthropic
claude-opus-4-7-highAnthropicProprietary
1497±7
+7 / -718,793$5 / $251MAnthropic
7
5 - 15
OpenAI
gpt-5.5-highOpenAIProprietary
1485±7
+7 / -716,816$2.50 / $151.1MOpenAI
8
7 - 17
Anthropic
claude-sonnet-4-6AnthropicProprietary
1483±6
+6 / -654,427$1.50 / $7.501MAnthropic
9
7 - 19
OpenAI
gpt-5.5OpenAIProprietary
1480±7
+7 / -717,286$2.50 / $151.1MOpenAI
10
5 - 20
OpenAI
gpt-5.6-terra-xhighOpenAIProprietary
1479±13
+13 / -131,969$2.50 / $15N/AOpenAI
11
4 - 21
OpenAI
gpt-5.6-sol-xhighOpenAIProprietary
1479±17
+17 / -171,152$5 / $30N/AOpenAI
12
7 - 20
Anthropic
claude-opus-4-8-highAnthropicProprietary
1475±8
+8 / -88,388$5 / $251MAnthropic
13
7 - 22
Meta
muse-spark-1.1MetaProprietary
1472±13
+13 / -132,054$1.25 / $4.251MMeta
14
7 - 22
Anthropic
claude-sonnet-5-highAnthropicProprietary
1470±10
+10 / -103,601$1 / $51MAnthropic
15
8 - 21
OpenAI
gpt-5.4OpenAIProprietary
1470±7
+7 / -729,809$2.50 / $151.1MOpenAI
16
8 - 22
Anthropic
claude-opus-4-8AnthropicProprietary
1469±8
+8 / -88,193$5 / $251MAnthropic
17
7 - 26
Google
gemini-3.5-flash-highGoogleProprietary
1465±15
+15 / -151,372$0.75 / $4.501MGoogle
18
9 - 23
Google
gemini-3.5-flash-mediumGoogleProprietary
1465±10
+10 / -103,689$0.75 / $4.501MGoogle
19
9 - 26
OpenAI
gpt-5.6-luna-xhighOpenAIProprietary
1462±13
+13 / -131,888$1 / $6N/AOpenAI
20
10 - 25
Anthropic
claude-opus-4-5-20251101AnthropicProprietary
1462±10
+10 / -107,965$5 / $25200KAnthropic
21
12 - 27
SpaceXAI
grok-4.5SpaceXAIProprietary
1454±12
+12 / -122,435$2 / $6500KSpaceXAI
22
17 - 26
Moonshot
kimi-k2.6MoonshotOpen
1451±8
+8 / -811,181$0.95 / $4262.1KMoonshot
23
18 - 28
Anthropic
claude-sonnet-4-5-20250929AnthropicProprietary
1446±7
+7 / -728,634$3 / $15200KAnthropic
24
18 - 28
Google
gemini-3.1-pro-previewGoogleProprietary
1445±6
+6 / -645,162$1 / $61MGoogle
25
14 - 33
Meta
muse-sparkMetaProprietary
1443±18
+18 / -181,078N/AN/AMeta
显示第 125 条,共 39 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。