Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

视频编辑榜由用户提出编辑指令,两个匿名模型对同一段视频进行相应修改,用户对比编辑效果的准确度、时序一致性与画质保留情况后投票选出更好的一方。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实视频编辑场景下越受用户认可。

正在生成榜单图...
展示数量8 个模型
8 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
开发厂商
1
1 - 3
MiniMax
minimax-h3MiniMaxOpen
1390±26
+26 / -26499MiniMax
2
1 - 3
Bytedance
dreamina-seedance-2.0-720pBytedanceProprietary
1358±14
+14 / -143,620Bytedance
3
1 - 3
Google
gemini-omni-flashGoogleProprietary
1358±15
+15 / -151,810Google
4
4 - 4
Alibaba-ATH
happyhorse-1.0Alibaba-ATHProprietary
1307±13
+13 / -133,115Alibaba-ATH
5
5 - 6
SpaceXAI
grok-imagine-videoSpaceXAIProprietary
1263±10
+10 / -1013,224SpaceXAI
6
5 - 6
KlingAI
kling-o3-proKlingAIProprietary
1255±12
+12 / -127,078KlingAI
7
7 - 8
KlingAI
kling-o1-proKlingAIProprietary
1200±10
+10 / -1010,045KlingAI
8
7 - 8
Runway
runway-gen4-alephRunwayProprietary
1183±8
+8 / -89,817Runway
显示第 18 条,共 8 条记录
每页显示:

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。