数据同步时间: 2026-09-07 09:20:59
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分。数字右下角的小字(例如 ±5)是 95% 置信区间,数值范围越窄说明这个评分的把握越大 | |||
|---|---|---|---|---|---|
1 | 1515±15 | ||||
2 | 1511±10 | ||||
3 | 1494±19 | ||||
4 | 1494±17 | ||||
5 | 1491±19 | ||||
6 | 1482±12 | ||||
7 | 1479±8 | ||||
8 | 1462±10 | ||||
9 | 1456±15 | ||||
10 | 1427±13 | ||||
11 | 1367±7 | ||||
12 | 1364±14 | ||||
13 | 1363±10 | ||||
14 | 1362±10 | ||||
15 | 1358±10 | ||||
16 | 1348±11 | ||||
17 | 1343±7 | ||||
18 | 1342±6 | ||||
19 | 1341±8 | ||||
20 | 1340±13 | ||||
21 | 1328±8 | ||||
22 | 1256±7 | ||||
23 | 1253±11 | ||||
24 | 1248±12 | ||||
25 | 1246±9 | ||||
显示第 1 到 25 条,共 48 条记录
每页显示:
1 / 2
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。