数据同步时间: 2026-08-17 20:11:32
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | |||||
|---|---|---|---|---|---|---|---|
1 | claude-opus-5-maxAnthropic • Proprietary | 1692 | |||||
2 | kimi-k3-maxMoonshot • Open | 1674 | |||||
3 | qwen3.8-maxAlibaba • Proprietary | 1667 | |||||
4 | claude-opus-5-highAnthropic • Proprietary | 1663 | |||||
5 | grok-4.6-highSpaceXAI • Proprietary | 1631 | |||||
6 | claude-fable-5Anthropic • Proprietary | 1627 | |||||
7 | gpt-5.6-sol-xhigh (codex-harness)OpenAI • Proprietary | 1622 | |||||
8 | gemini-3.7-flash-highGoogle • Proprietary | 1587 | |||||
9 | glm-5.2-maxZ.ai • Open | 1585 | |||||
10 | deepseek-v4-pro-high-20260813DeepSeek • Open | 1584 | |||||
11 | deepseek-v4-flash-highDeepSeek • Open | 1581 | |||||
12 | claude-opus-4-8-highAnthropic • Proprietary | 1564 | |||||
13 | claude-opus-4-7Anthropic • Proprietary | 1558 | |||||
14 | claude-opus-4-7-highAnthropic • Proprietary | 1557 | |||||
15 | grok-4.5SpaceXAI • Proprietary | 1555 | |||||
16 | claude-opus-4-6-highAnthropic • Proprietary | 1545 | |||||
17 | claude-sonnet-5-highAnthropic • Proprietary | 1540 | |||||
18 | claude-opus-4-8Anthropic • Proprietary | 1539 | |||||
19 | muse-spark-1.1Meta • Proprietary | 1538 | |||||
20 | claude-opus-4-6Anthropic • Proprietary | 1537 | |||||
21 | gemini-3.6-flash-highGoogle • Proprietary | 1537 | |||||
22 | muse-spark-1.2 (xHigh)Meta • Proprietary | 1535 | |||||
23 | claude-sonnet-4-6Anthropic • Proprietary | 1524 | |||||
24 | hy3Tencent • Open | 1522 | |||||
25 | seed-2.1-pro-previewBytedance • Proprietary | 1522 | |||||
显示第 1 到 25 条,共 115 条记录
每页显示:
1 / 5
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。