Arena AI 中文镜像

前端开发模型排行榜

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-09-07 09:20:59
关于这份榜单

前端开发榜采用真实前端开发任务:用户给出同一需求(比如"做一个贪吃蛇小游戏"),两个匿名模型各自在沙盒环境中生成可运行的网页应用,用户实际点击、体验后再投票选出更好的一方,评测内容涵盖代码正确性、界面还原度,以及需要多步推理、调用工具的 Agentic 编程能力。得分同样经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实建站场景下越受开发者认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-09-07 09:20:59
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 2
USOpenAIGPT 6 Astra (Max)
1797±24
1199$10 / $501.1MOpenAI
2
1 - 2
USAnthropicClaude Fable 5.1 (Max)
1762±16
2275$10 / $501MAnthropic
3
3 - 6
USAnthropicClaude Opus 5 (Max)
1688±8
1,0904$5 / $251MAnthropic
4
3 - 6
CNAlibabaQwen 3.8 (Max 0902)
1686±16
1868$2 / $6N/AAlibaba
5
3 - 7
CNMoonshotKimi K3 (Max)
1674±11
4546$3 / $151MMoonshot
6
3 - 7
CNAlibabaQwen 3.8 (Max)
1670±12
3223$2 / $61MAlibaba
7
5 - 7
USAnthropicClaude Opus 5 (High)
1661±7
1,0928$5 / $251MAnthropic
8
8 - 14
USAnthropicClaude Fable 5
1629±8
9356$10 / $501MAnthropic
9
8 - 15
CNAlibabaQwen 3.8 Flash Next
1626±14
2158$0.16 / $0.471MAlibaba
10
8 - 15
USSpaceXAIGrok 4.6 (High)
1625±11
3487$2 / $6500KSpaceXAI
11
8 - 16
USMetaMuse Spark 1.3 (xHigh)
1622±18
1274$1.25 / $4.251MMeta
12
8 - 15
CNTencentHy4 (Preview)
1621±16
1661$0.83 / $2.501MTencent
13
8 - 15
USOpenAIGPT 5.6 Sol (xHigh)
1617±7
1,1014$4 / $201.1MOpenAI
14
8 - 17
CNZ.aiGLM 5.3 (Max)
1609±12
2930$1.40 / $4.401MZ.ai
15
9 - 19
CNZ.aiGLM 5.3 Flash
1605±15
1961$0.15 / $0.501MZ.ai
16
13 - 20
CNAlibabaQwen 3.8 (27B)
1594±11
3543$0.40 / $3N/AAlibaba
17
14 - 21
USGoogleGemini 3.7 Flash (High)
1587±12
3008$0.75 / $3.751MGoogle
18
15 - 21
CNZ.aiGLM 5.2 (Max)
1587±7
9836$1.40 / $4.401MZ.ai
19
15 - 21
CNDeepSeekDeepseek V4 Pro (High)
1582±11
3518$1.32 / $3.96N/ADeepSeek
20
16 - 21
CNDeepSeekDeepseek V4 Flash (High)
1580±10
4177$0.44 / $1.321MDeepSeek
21
17 - 25
USGoogleGemini 3.8 Flash (High)
1567±12
2727$0.75 / $3.751MGoogle
22
21 - 25
USAnthropicClaude Opus 4.8 (High)
1563±7
1,2937$5 / $251MAnthropic
23
21 - 26
USAnthropicClaude Opus 4.7
1557±6
1,5724$5 / $251MAnthropic
24
21 - 28
USSpaceXAIGrok 4.5
1556±8
7361$2 / $6500KSpaceXAI
25
21 - 26
USAnthropicClaude Opus 4.7 (High)
1556±6
1,6219$5 / $251MAnthropic
显示第 125 条,共 126 条记录
每页显示:
1 / 6

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。