Arena AI 中文镜像

图生网页模型排行榜

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-09-07 09:20:59
关于这份榜单

图生网页榜由用户上传同一张截图或设计稿,两个匿名模型各自在沙盒环境中还原生成可运行的网页,用户实际点击、体验后对比布局还原度、视觉细节复刻精度与代码正确性再投票选出更好的一方。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在看图建站场景下越受开发者认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-09-07 09:20:59
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 1
USAnthropicClaude Opus 5 (Max)
1664±16
1765$5 / $251MAnthropic
2
2 - 4
USAnthropicClaude Fable 5
1623±12
3229$10 / $501MAnthropic
3
2 - 4
CNAlibabaQwen 3.8 (Max)
1618±15
1869$2 / $61MAlibaba
4
2 - 4
USOpenAIGPT 5.6 Sol (xHigh)
1606±15
1758$4 / $201.1MOpenAI
5
5 - 9
USAnthropicClaude Opus 4.7 (High)
1576±10
5997$5 / $251MAnthropic
6
5 - 10
USSpaceXAIGrok 4.5
1574±15
1669$2 / $6500KSpaceXAI
7
5 - 10
CNAlibabaQwen 3.8 (27B)
1574±15
1686$0.40 / $3N/AAlibaba
8
5 - 10
CNMoonshotKimi K3 (Max)
1573±17
1382$3 / $151MMoonshot
9
5 - 10
USAnthropicClaude Opus 4.7
1564±9
6430$5 / $251MAnthropic
10
6 - 19
USGoogleGemini 3.6 Flash (High)
1544±16
1412$0.75 / $3.751MGoogle
11
10 - 18
USAnthropicClaude Sonnet 5 (High)
1543±10
4358$2 / $101MAnthropic
12
10 - 18
USAnthropicClaude Opus 4.6 (High)
1541±9
7006$5 / $251MAnthropic
13
10 - 19
USAnthropicClaude Opus 4.6
1539±9
7086$5 / $251MAnthropic
14
10 - 20
USMetaMuse Spark 1.1
1537±13
2484$1.25 / $4.251MMeta
15
10 - 21
USOpenAIGPT 5.6 Terra (xHigh)
1534±15
1649$2 / $121MOpenAI
16
10 - 21
USOpenAIGPT 5.5 (xHigh)
1530±10
5971$5 / $30N/AOpenAI
17
10 - 21
USAnthropicClaude Sonnet 4.6
1529±9
7334$1.50 / $7.501MAnthropic
18
10 - 24
CNMoonshotKimi K2.6
1521±12
3356$0.95 / $4262.1KMoonshot
19
14 - 25
USOpenAIGPT 5.5 (High)
1516±9
6477$5 / $301.1MOpenAI
20
12 - 25
CNMoonshotKimi K2.7 Code
1511±21
843$0.66 / $3.40262.1KMoonshot
21
15 - 25
CNBytedanceSeed 2.1 Pro (Preview)
1508±14
1815N/AN/ABytedance
22
18 - 25
USOpenAIGPT 5.5 (codex-harness)
1501±9
6115$5 / $301.1MOpenAI
23
18 - 26
USGoogleGemini 3.5 Flash (Medium)
1499±13
2415$0.75 / $4.501MGoogle
24
18 - 27
USOpenAIGPT 5.6 Luna (xHigh)
1496±15
1693$0.20 / $1.201MOpenAI
25
19 - 28
USGoogleGemini 3.5 Flash (High)
1494±15
1656$0.75 / $4.501MGoogle
显示第 125 条,共 44 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。