数据同步时间: 2026-08-17 20:11:32
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | ||||||
|---|---|---|---|---|---|---|---|---|
1 | claude-fable-5Anthropic • Proprietary | 1506±5 | ||||||
2 | claude-opus-4-6-highAnthropic • Proprietary | 1505±4 | ||||||
3 | claude-opus-4-7-highAnthropic • Proprietary | 1502±4 | ||||||
4 | muse-spark-1.2 (xHigh)Meta • Proprietary | 1498±10 | ||||||
5 | claude-opus-4-6Anthropic • Proprietary | 1497±3 | ||||||
6 | claude-opus-4-7Anthropic • Proprietary | 1494±4 | ||||||
7 | claude-opus-5-highAnthropic • Proprietary | 1493±5 | ||||||
8 | qwen3.8-maxAlibaba • Proprietary | 1491±8 | ||||||
9 | gemini-3.7-flash-highGoogle • Proprietary | 1490±8 | ||||||
10 | claude-opus-5-maxAnthropic • Proprietary | 1489±7 | ||||||
11 | muse-spark-1.1Meta • Proprietary | 1489±6 | ||||||
12 | kimi-k3-maxMoonshot • Open | 1489±6 | ||||||
13 | muse-sparkMeta • Proprietary | 1488±6 | ||||||
14 | gemini-3.1-pro-previewGoogle • Proprietary | 1486±3 | ||||||
15 | gemini-3-proGoogle • Proprietary | 1485±4 | ||||||
16 | gemini-3.6-flash-highGoogle • Proprietary | 1484±6 | ||||||
17 | gpt-5.5-highOpenAI • Proprietary | 1482±4 | ||||||
18 | claude-opus-4-8-highAnthropic • Proprietary | 1481±5 | ||||||
19 | gpt-5.6-sol-xhighOpenAI • Proprietary | 1481±6 | ||||||
20 | gemini-3.5-flash-highGoogle • Proprietary | 1477±5 | ||||||
21 | gpt-5.5OpenAI • Proprietary | 1477±4 | ||||||
22 | gpt-5.4-highOpenAI • Proprietary | 1476±4 | ||||||
23 | gpt-5.2-chat-latest-20260210OpenAI • Proprietary | 1476±4 | ||||||
24 | grok-4.20-beta1SpaceXAI • Proprietary | 1475±5 | ||||||
25 | gemini-3.5-flash-mediumGoogle • Proprietary | 1474±5 | ||||||
显示第 1 到 25 条,共 390 条记录
每页显示:
1 / 16
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。