正在加载榜单数据...
基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。
正在加载榜单数据...
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大 | |||||
|---|---|---|---|---|---|---|---|
1 | 1516±7 | ||||||
2 | 1513±15 | ||||||
3 | 1507±6 | ||||||
4 | 1507±6 | ||||||
5 | 1496±8 | ||||||
6 | 1495±6 | ||||||
7 | 1495±7 | ||||||
8 | 1486±6 | ||||||
9 | 1484±6 | ||||||
10 | 1483±9 | ||||||
11 | 1482±6 | ||||||
12 | 1475±7 | ||||||
13 | 1472±8 | ||||||
14 | 1471±6 | ||||||
15 | 1471±18 | ||||||
16 | 1468±14 | ||||||
17 | 1466±8 | ||||||
18 | 1465±9 | ||||||
19 | 1464±7 | ||||||
20 | 1463±8 | ||||||
21 | 1462±10 | ||||||
22 | 1461±9 | ||||||
23 | 1457±8 | ||||||
24 | 1456±11 | ||||||
25 | 1452±12 | ||||||
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。