Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 20:11:32
关于这份榜单

图像编辑榜由用户上传自己的图片,交给两个匿名模型完成同一项编辑指令(既有单图编辑,也有多图编辑场景),用户对比修改结果后投票选出更好的一方,涵盖产品设计、人像精修、写实场景等多个细分类目。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在指令理解准确度与画面一致性保持上越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 20:11:32
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
开发厂商
1
1 - 1
OpenAI
gpt-image-2 (medium)OpenAIProprietary
1463±4
+4 / -4184,189OpenAI
2
2 - 2
SpaceXAI
grok-imagine-image-2.0 (low)SpaceXAIProprietary
1439±8
+8 / -85,931SpaceXAI
3
3 - 4
Meta
muse-imageMetaProprietary
1405±6
+6 / -647,573Meta
4
3 - 4
Microsoft AI
mai-image-2.5Microsoft AIProprietary
1402±4
+4 / -4155,115Microsoft AI
5
5 - 10
Bytedance
seedream-5.0-proBytedanceProprietary
1393±4
+4 / -471,266Bytedance
6
5 - 10
OpenAI
chatgpt-image-latest-high-fidelity (20251216)OpenAIProprietary
1390±3
+3 / -3494,514OpenAI
7
5 - 10
SpaceXAI
grok-imagine-image-quality (20260519)SpaceXAIProprietary
1390±6
+6 / -635,613SpaceXAI
8
5 - 10
Google
gemini-3-pro-image-2k (nano-banana-pro)GoogleProprietary
1389±3
+3 / -3501,853Google
9
5 - 10
Google
gemini-3-pro-image-preview (nano-banana-pro)GoogleProprietary
1385±3
+3 / -3519,141Google
10
5 - 10
Google
gemini-3.1-flash-image (nano-banana-2) [web-search]GoogleProprietary
1385±4
+4 / -4102,657Google
11
11 - 12
Reve
reve-2.1ReveProprietary
1374±6
+6 / -619,093Reve
12
11 - 12
OpenAI
gpt-image-1.5-high-fidelityOpenAIProprietary
1370±3
+3 / -3516,635OpenAI
13
13 - 14
SpaceXAI
grok-imagine-image-qualitySpaceXAIProprietary
1362±4
+4 / -4155,532SpaceXAI
14
13 - 14
Reve
reve-2.0ReveProprietary
1358±7
+7 / -717,504Reve
15
15 - 16
Luma AI
uni-1.1-maxLuma AIProprietary
1334±5
+5 / -540,939Luma AI
16
15 - 16
SpaceXAI
grok-imagine-imageSpaceXAIProprietary
1330±3
+3 / -3539,954SpaceXAI
17
17 - 18
Google
gemini-3.1-flash-lite-image (nano-banana-2-lite)GoogleProprietary
1314±5
+5 / -559,331Google
18
17 - 18
Luma AI
uni-1.1Luma AIProprietary
1312±4
+4 / -4103,819Luma AI
19
19 - 23
Alibaba
qwen-image-2.0-pro-2026-06-22AlibabaProprietary
1303±5
+5 / -550,804Alibaba
20
19 - 23
Tencent
hunyuan-image-3.0-instructTencentOpen
1302±3
+3 / -3307,840Tencent
21
19 - 23
Alibaba
wan2.7-image-proAlibabaProprietary
1302±4
+4 / -441,548Alibaba
22
19 - 23
Alibaba
wan2.7-imageAlibabaProprietary
1301±4
+4 / -442,400Alibaba
23
19 - 23
Bytedance
seedream-4.5BytedanceProprietary
1301±2
+2 / -2982,872Bytedance
24
24 - 25
Google
gemini-2.5-flash-image-preview (nano-banana)GoogleProprietary
1294±2
+2 / -211,094,450Google
25
24 - 25
Bytedance
seedream-5.0-liteBytedanceProprietary
1293±3
+3 / -3315,388Bytedance
显示第 125 条,共 53 条记录
每页显示:
1 / 3

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。