Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

文生视频榜由用户输入同一段文字描述,两个匿名模型各自生成一段视频,用户对比画面质量、动作连贯性与指令还原度后投票选出更好的一方。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实文生视频场景下越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
开发厂商
1
1 - 2
Google
gemini-omni-flashGoogleProprietary
1512±11
+11 / -1115,930Google
2
1 - 3
Black Forest Labs
flux-3-videoBlack Forest LabsProprietary
1496±17
+17 / -171,288Black Forest Labs
3
2 - 4
Bytedance
dreamina-seedance-2.0-720pBytedanceProprietary
1478±9
+9 / -948,355Bytedance
4
3 - 5
Meta
muse-videoMetaProprietary
1457±15
+15 / -152,176Meta
5
4 - 6
MiniMax
minimax-h3MiniMaxOpen
1453±14
+14 / -142,192MiniMax
6
5 - 6
Alibaba-ATH
happyhorse-1.0Alibaba-ATHProprietary
1428±13
+13 / -1322,117Alibaba-ATH
7
7 - 11
OpenAI
sora-2-proOpenAIProprietary
1366±7
+7 / -745,731OpenAI
8
7 - 15
Google
veo-3.1-audioGoogleProprietary
1364±14
+14 / -1413,743Google
9
7 - 13
Google
veo-3.1-audio-1080pGoogleProprietary
1363±10
+10 / -1024,981Google
10
7 - 15
Google
veo-3.1-fast-audioGoogleProprietary
1362±10
+10 / -1039,441Google
11
7 - 15
Google
veo-3.1-fast-audio-1080pGoogleProprietary
1358±10
+10 / -1025,778Google
12
8 - 17
Google
veo-3-fast-audioGoogleProprietary
1347±11
+11 / -1125,219Google
13
8 - 17
SpaceXAI
grok-imagine-video-720pSpaceXAIProprietary
1347±7
+7 / -7153,823SpaceXAI
14
9 - 17
Alibaba
wan2.7-t2vAlibabaProprietary
1343±8
+8 / -816,757Alibaba
15
12 - 17
OpenAI
sora-2OpenAIProprietary
1340±7
+7 / -761,754OpenAI
16
9 - 17
Google
veo-3-audioGoogleProprietary
1339±13
+13 / -1319,007Google
17
12 - 17
Alibaba
wan2.6-t2vAlibabaProprietary
1333±8
+8 / -843,230Alibaba
18
18 - 22
Bytedance
seedance-v1.5-proBytedanceProprietary
1256±7
+7 / -776,001Bytedance
19
18 - 22
Google
veo-3GoogleProprietary
1253±11
+11 / -1114,986Google
20
18 - 22
Alibaba
wan2.5-t2v-previewAlibabaProprietary
1249±9
+9 / -927,361Alibaba
21
18 - 22
Google
veo-3-fastGoogleProprietary
1248±12
+12 / -1215,271Google
22
18 - 25
P
pixverse-v5.6ProprietaryOpen
1240±11
+11 / -1132,303Proprietary
23
22 - 28
Runway
runway-gen-4.5RunwayProprietary
1223±10
+10 / -1037,911Runway
24
22 - 31
KlingAI
kling-2.5-turbo-1080pKlingAIProprietary
1219±17
+17 / -172,105KlingAI
25
23 - 28
KlingAI
kling-2.6-proKlingAIProprietary
1217±7
+7 / -773,169KlingAI
显示第 125 条,共 44 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。