正在加载榜单数据...
基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。
正在加载榜单数据...
排名 | 模型 | 净改善度 净改善度:相比于基线模型,Agent 在任务解决成功率上的提升幅度。数字右下角的小字(例如 ±1.71%)是 95% 置信区间,数值范围越窄说明这个结果的把握越大 | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
1 | +13.71%±1.72% | ||||||||||||
2 | +11.54%±2.1% | ||||||||||||
3 | +10.25%±1.41% | ||||||||||||
4 | +10.16%±1.55% | ||||||||||||
5 | +8.81%±1.25% | ||||||||||||
6 | +8.19%±1.27% | ||||||||||||
7 | +7.10%±1.28% | ||||||||||||
8 | +6.22%±0.62% | ||||||||||||
9 | +5.97%±1.62% | ||||||||||||
10 | +5.03%±0.92% | ||||||||||||
11 | +5.01%±1.02% | ||||||||||||
12 | +4.88%±1.33% | ||||||||||||
13 | +4.71%±1.91% | ||||||||||||
14 | +4.37%±0.69% | ||||||||||||
15 | +4.20%±0.86% | ||||||||||||
16 | +4.14%±0.79% | ||||||||||||
17 | +3.30%±0.84% | ||||||||||||
18 | +3.05%±0.62% | ||||||||||||
19 | +2.92%±0.99% | ||||||||||||
20 | +2.67%±0.81% | ||||||||||||
21 | +2.01%±1.05% | ||||||||||||
22 | +1.80%±0.73% | ||||||||||||
23 | +1.44%±1.11% | ||||||||||||
24 | +1.26%±0.8% | ||||||||||||
25 | +1.15%±0.67% | ||||||||||||
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。
Arena 的智能体模式(Agent Mode)会将每一次真实的会话路由给一个随机选择的模型,并观察该模型实际执行任务的表现。当前的智能体排行榜根据模型在数百万次真实的、野外的智能体模式交互中作为“协调器(Orchestrator)”(即决定调用哪些工具,如 bash、网页搜索、获取页面、写入文件等的主模型)的表现进行排名。
与让用户在两个并排的回答中投票不同,智能体模式收集单线程的用户反馈,并根据模型在执行真实任务期间的实际表现进行评分。
大多数 Arena 排行榜都是基于成对的人类投票:您看到两个匿名的回答并选择较好的那个,评分来自这些两两对决。智能体排行榜在以下三个方面有所不同:
由于智能体模式将每个会话随机分配给不同的模型,我们可以通过观察模型行为来推断其因果干预效应。对于每个信号,我们计算每个模型的得分,并将其表示为与代表平均模型的随机基线相比的百分点差异。这种针对每个模型、每个信号的对比即为净改善度 (Net Improvement):即换用特定模型后,某种行为改善或恶化的程度。正值表示高于平均水平,负值表示低于平均水平。需要注意的是,随着平均模型越来越强,基准线也会随之提高,因此任何特定模型的净改善度可能会下降。这意味着排行榜是实时动态的,反映了模型相对于所有实验室最新旗舰模型的表现。
主排名是模型在所有信号上的净改善度的加权平均值,因此每个信号都拥有一票。目前,这个平均值是等权重的,但我们未来可能会做出调整。我们还显示了每个数字的 95% 置信区间,这样您就可以看出两个模型是真的存在实力差距,还是过于接近以至于无法断定输赢。
“好”和“坏”是根据每个信号自身的天然方向定义的。对于某些信号,数值越高越好(例如成功执行的修正、确认的成功);而对于另一些信号,数值越低越好(例如较少的工具幻觉)。排行榜始终对数值进行定向和配色,使得绿色始终代表表现良好,无需用户自行换算。
要深入了解我们如何挖掘轨迹和计算干预效应,请参阅官方的 方法论撰写 (Methodology Write-up)。
排行榜上的每个分数都是一个干预效应(Treatment Effect),表示如果用特定协调器替换平均协调器,在各个信号上所能获得的改善。绿色高亮表示该模型优于典型模型,红色高亮表示劣于典型模型,接近零的分数表示处于平均水平。因此,7% 表示明显高于平均水平,而 -3% 表示略低于平均水平。
每个模型旁边的粗体大字是其综合评分:它在每个信号上的百分比平均值。每个信号列显示了该模型在这一特定行为上的百分比,便于您发现模型的优势与劣势。
数字后面的小“±”是 95% 置信区间,表示基于目前收集的数据我们的把握程度。例如,5% ± 2% 的得分实际意味着“大约在 3% 到 7% 之间”。当两个模型的范围重叠较多时,应将它们视为基本持平,而不要过分纠结于具体名次。
需要记住的一点是:对于少数信号,数值越低反而是越好的结果(例如减少调用不存在的幻觉工具)。排行榜始终将好的一向着色为绿色,因此您可以直接将绿色理解为“表现良好”,而无需在脑海中进行数学换算。
信号是从真实会话轨迹中评分的单个独立、可测量的行为。每个信号都捕获了做好工作的不同维度,主分数是所有这些信号的等权平均值。当前的信号包括:
会的。排行榜是一个动态的测量系统,而不是一次性的静态评分。它随着新的真实智能体模式会话的接入而刷新,因此随着我们收集到更多关于模型行为的证据,模型的分数可能会发生变动。您随时可以查看“上次更新”的日期以及当前排行榜背后的观测数据量。
当新模型加入时,排名也可能会发生移动。每个分数都是相对于平均模型进行测量的,因此加入一个强大的新模型会抬高其他人比较的门槛,而加入一个较弱的模型则会降低门槛。这意味着即使模型自身行为没有发生改变,它的分数也可能会因为竞争对手的变化而出现微调。这就像有更聪明的对手加入时,国际象棋比赛会变得更难一样:您的棋艺没有变,但对手的水平变了。
随着更多会话的积累,误差范围也会缩小,模型之间微小的实力差距随着时间的推移会变得更加清晰。
是的。当前的集合只是一个起点,评估框架在设计上是可扩展的。我们已经追踪了几个尚未计入主评分的附加行为(例如清洁延续、不批准、会话内重试和工具错误率),并计划在每个新信号得到验证后,逐步将它们纳入进来以丰富评估体系。