Arena AI 中文镜像

国内大模型排名

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-10-03 14:00:17
关于这份榜单

国内大模型排名取自 Arena 文本对话榜,只保留厂商总部在中国的模型(如 DeepSeek、通义千问、Kimi、智谱 GLM 等),按其在全球榜上的相对顺序重新编号。分数来自全球真实用户的双盲对比投票,不是国内专项测评;同一模型的不同推理档位(如 High、Max)会分别列出。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-10-03 14:00:17
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
8 - 29
CNMoonshotKimi K3 (Max)
1488±5
2,8280N/AN/AMoonshot
2
12 - 43
CNAlibabaQwen 3.8 (Max)
1482±5
2,3353$2 / $61MAlibaba
3
10 - 50
CNXiaomiMimo V2.6 Pro
1480±9
4056$0.43 / $0.871.1MXiaomi
4
15 - 46
CNZ.aiGLM 5.3 (Max)
1478±6
1,7857$1.40 / $4.401MZ.ai
5
20 - 48
CNZ.aiGLM 5.2 (Max)
1476±4
4,5399$1.40 / $4.401MZ.ai
6
13 - 59
CNAlibabaQwen 3.7 Max (Preview)
1475±10
3920$1.48 / $4.421MAlibaba
7
20 - 57
CNDeepSeekDeepseek V4.1 Flash (Max)
1474±7
8728$0.30 / $1.201MDeepSeek
8
22 - 57
CNZ.aiGLM 5.3 Flash
1473±5
2,2971$0.06 / $0.201MZ.ai
9
29 - 61
CNBaiduErnie 5.1
1468±5
3,9396$0.56 / $2.54119KBaidu
10
33 - 61
CNXiaomiMimo V2.5 Pro
1468±4
7,0871$0.43 / $0.871.1MXiaomi
11
38 - 69
CNAlibabaQwen 3.5 Max (Preview)
1465±5
2,2555$1.20 / $6N/AAlibaba
12
41 - 66
CNZ.aiGLM 5.1
1465±4
5,8358$1.40 / $4.40202.8KZ.ai
13
33 - 76
CNDeepSeekDeepseek V4 Pro (High)
1464±7
9780$1.32 / $3.96N/ADeepSeek
14
46 - 77
CNMoonshotKimi K2.6
1461±4
3,9936$0.95 / $4262.1KMoonshot
15
39 - 82
CNAlibabaQwen 3.6 Max (Preview)
1460±8
5406$1.03 / $6.16262.1KAlibaba
16
50 - 79
CNDeepSeekDeepseek V4 Pro
1458±4
5,7478$1.32 / $3.961MDeepSeek
17
50 - 80
CNZ.aiGLM 5
1458±4
2,9174$1 / $3.20204.8KZ.ai
18
55 - 81
CNBytedanceDola Seed 2.0 Pro
1456±3
7,8890N/AN/ABytedance
19
49 - 87
CNTencentHy3
1456±7
1,0476$0.13 / $0.53262.1KTencent
20
55 - 82
CNAlibabaQwen 3.7 Plus
1456±4
4,1908$0.32 / $1.281MAlibaba
21
56 - 83
CNDeepSeekDeepseek V4 Pro High (Preview)
1455±4
5,4767$1.32 / $3.961MDeepSeek
22
47 - 98
CNStepFunStep 5 Preview
1454±11
2701N/AN/AStepFun
23
56 - 97
CNXiaomiMimo V2.6 Flash
1452±8
6053$0.14 / $0.281MXiaomi
24
63 - 91
CNMoonshotKimi K2.5 (Thinking)
1450±3
7,4565$0.60 / $3N/AMoonshot
25
60 - 99
CNBaiduErnie 5.0 (Preview)
1449±7
9788N/AN/ABaidu
显示第 1 到 25 条,共 135 条记录
每页显示:
1 / 6

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。