Arena AI 中文镜像

文生视频模型排行榜

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-09-07 09:20:59
关于这份榜单

文生视频榜由用户输入同一段文字描述,两个匿名模型各自生成一段视频,用户对比画面质量、动作连贯性与指令还原度后投票选出更好的一方。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实文生视频场景下越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-09-07 09:20:59
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
开发厂商
1
1 - 5
USGoogleGemini Omni 1.1 Flash
1515±15
1777Google
2
1 - 5
USGoogleGemini Omni Flash
1511±10
2,1934Google
3
1 - 7
CNAlibabaWan 3.0
1494±19
1167Alibaba
4
1 - 7
DEBlack Forest LabsFlux 3 Video
1494±17
1290Black Forest Labs
5
1 - 7
USSpaceXAIGrok Imagine Video 1.5 (Agent)
1491±19
1195SpaceXAI
6
3 - 9
CNBytedanceDreamina Seedance 2.5 720p
1482±12
4066Bytedance
7
3 - 9
CNBytedanceDreamina Seedance 2.0 720p
1479±8
5,2864Bytedance
8
6 - 9
CNMiniMaxMinimax H3
1462±10
7648MiniMax
9
6 - 9
USMetaMuse Video
1456±15
2178Meta
10
10 - 10
CNAlibaba-ATHHappyhorse 1.0
1427±13
2,2116Alibaba-ATH
11
11 - 15
USOpenAISora 2 Pro
1367±7
5,0415OpenAI
12
11 - 17
USGoogleVeo 3.1 Audio
1364±14
1,3703Google
13
11 - 17
USGoogleVeo 3.1 Audio 1080p
1363±10
2,4979Google
14
11 - 17
USGoogleVeo 3.1 Fast Audio
1362±10
3,9373Google
15
11 - 20
USGoogleVeo 3.1 Fast Audio 1080p
1358±10
2,5770Google
16
12 - 20
USGoogleVeo 3 Fast Audio
1348±11
2,5169Google
17
15 - 20
USSpaceXAIGrok Imagine Video 720p
1343±7
15,9930SpaceXAI
18
15 - 20
USOpenAISora 2
1342±6
6,7388OpenAI
19
15 - 21
CNAlibabaWan 2.7 T2v
1341±8
2,3025Alibaba
20
12 - 21
USGoogleVeo 3 Audio
1340±13
1,8941Google
21
19 - 21
CNAlibabaWan 2.6 T2v
1328±8
4,9348Alibaba
22
22 - 26
CNBytedanceSeedance V1.5 Pro
1256±7
7,5891Bytedance
23
22 - 26
USGoogleVeo 3
1253±11
1,4951Google
24
22 - 27
USGoogleVeo 3 Fast
1248±12
1,5225Google
25
22 - 26
CNAlibabaWan 2.5 T2v (Preview)
1246±9
3,2461Alibaba
显示第 125 条,共 48 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。