Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

文生图榜由用户输入同一段文字描述,两个匿名模型各自生成一张图片,用户凭直觉投票选出更好的一张,场景细分为写实摄影、二次元/卡通、3D 建模、产品设计、人像与文字渲染等多个方向。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在对应风格下的生成质量、指令还原度与美学表现越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
开发厂商
1
1 - 1
OpenAI
gpt-image-2 (medium)OpenAIProprietary
1381±5
+5 / -570,065OpenAI
2
2 - 3
Microsoft AI
mai-image-2.6-previewMicrosoft AIProprietary
1336±11
+11 / -113,488Microsoft AI
3
2 - 4
SpaceXAI
grok-imagine-image-2.0 (low)SpaceXAIProprietary
1316±12
+12 / -122,676SpaceXAI
4
3 - 4
Reve
reve-2.1ReveProprietary
1302±8
+8 / -87,588Reve
5
5 - 6
Meta
muse-imageMetaProprietary
1282±7
+7 / -715,119Meta
6
5 - 8
Reve
reve-2.0ReveProprietary
1270±6
+6 / -614,641Reve
7
6 - 10
Google
gemini-3.1-flash-image (nano-banana-2) [web-search]GoogleProprietary
1264±5
+5 / -529,102Google
8
7 - 11
Bytedance
seedream-5.0-proBytedanceProprietary
1258±5
+5 / -528,830Bytedance
9
6 - 12
Alibaba
qwen-image-3.0-proAlibabaProprietary
1257±9
+9 / -94,705Alibaba
10
7 - 11
Microsoft AI
mai-image-2.5Microsoft AIProprietary
1256±4
+4 / -446,329Microsoft AI
11
8 - 12
Google
gemini-3.1-flash-lite-image (nano-banana-2-lite)GoogleProprietary
1251±6
+6 / -616,400Google
12
10 - 12
Google
gemini-3-pro-image-2k (nano-banana-pro)GoogleProprietary
1246±3
+3 / -3139,851Google
13
13 - 14
OpenAI
gpt-image-1.5-high-fidelityOpenAIProprietary
1239±3
+3 / -3143,295OpenAI
14
13 - 15
Google
gemini-3-pro-image-preview (nano-banana-pro)GoogleProprietary
1232±5
+5 / -582,828Google
15
14 - 15
SpaceXAI
grok-imagine-image-qualitySpaceXAIProprietary
1228±4
+4 / -449,971SpaceXAI
16
16 - 16
Ideogram
ideogram-4.0-qualityIdeogramOpen
1204±5
+5 / -529,064Ideogram
17
17 - 21
Alibaba
qwen-image-2.0-pro-2026-06-22AlibabaProprietary
1191±6
+6 / -612,021Alibaba
18
17 - 21
Luma AI
uni-1.1-maxLuma AIProprietary
1188±6
+6 / -613,487Luma AI
19
17 - 22
Microsoft AI
mai-image-2Microsoft AIProprietary
1183±5
+5 / -549,211Microsoft AI
20
17 - 22
Luma AI
uni-1.1Luma AIProprietary
1181±5
+5 / -527,791Luma AI
21
17 - 23
Nvidia
Cosmos3-Super-Text2Image (Agentic)NvidiaOpen
1175±10
+10 / -103,519Nvidia
22
21 - 23
SpaceXAI
grok-imagine-imageSpaceXAIProprietary
1171±3
+3 / -3218,917SpaceXAI
23
19 - 28
Recraft
recraft-v4.1-utility-proRecraftProprietary
1169±11
+11 / -112,519Recraft
24
23 - 28
Black Forest Labs
flux-2-maxBlack Forest LabsProprietary
1162±4
+4 / -4117,440Black Forest Labs
25
23 - 29
SpaceXAI
grok-imagine-image-proSpaceXAIProprietary
1161±4
+4 / -493,690SpaceXAI
显示第 125 条,共 77 条记录
每页显示:
1 / 4

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。