Arena AI 中文镜像

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-09-07 09:20:59
Agent 榜
Top 5
排名模型净改善度
净改善度指该模型相比基线模型,在复杂多步规划、工具调用、代码及浏览器自动化等任务的解决成功率上的提升幅度,而非绝对成功率本身。
#1AnthropicClaude Fable 5.1 (Max)15.87%
#2AnthropicClaude Opus 5 (High)12.68%
#3AnthropicClaude Opus 5 (Max)11.67%
#4AnthropicClaude Fable 5 (High)10.23%
#5OpenAIGPT 5.6 Sol (xHigh)9.31%
查看完整榜单
文本对话榜
Top 5
排名模型Elo 评分
基于用户双盲对比投票,采用 Bradley-Terry 算法计算出的相对竞技能力分值(Elo 积分),分数越高代表盲测中表现越优异。
#1AnthropicClaude Fable 51507
#2AnthropicClaude Opus 4.6 (High)1505
#3AnthropicClaude Fable 5.1 (Max)1504
#4AnthropicClaude Opus 4.7 (High)1502
#5MetaMuse Spark 1.2 (xHigh)1499
查看完整榜单
前端开发榜
Top 5
排名模型Elo 评分
反映模型在沙盒环境中现场生成可运行网页应用的相对实力积分,涵盖代码正确性、界面还原度与多步推理能力。分数越高代表前端开发能力越强。
#1OpenAIGPT 6 Astra (Max)1797
#2AnthropicClaude Fable 5.1 (Max)1762
#3AnthropicClaude Opus 5 (Max)1688
#4AlibabaQwen 3.8 (Max 0902)1686
#5MoonshotKimi K3 (Max)1674
查看完整榜单
视觉多模态榜
Top 5
排名模型Elo 评分
反映模型在理解输入图片、图表分析、视觉常识推理及多模态对话上的相对实力积分。
#1AnthropicClaude Fable 51313
#2AnthropicClaude Opus 4.7 (High)1301
#3AlibabaQwen 3.8 (Max)1300
#4AnthropicClaude Opus 4.71299
#5AnthropicClaude Opus 4.6 (High)1299
查看完整榜单
搜索增强榜
Top 5
排名模型Elo 评分
基于用户双盲对比投票计算出的搜索增强类任务(如 RAG、实时信息检索问答)的相对实力积分。分数越高代表实时检索整合能力越强。
#1OpenAIGPT 5.6 Sol (xHigh)1257
#2AnthropicClaude Opus 4.6 Search1253
#3OpenAIGPT 5.5 Search1242
#4AnthropicClaude Opus 4.71233
#5AnthropicClaude Fable 51230
查看完整榜单
文档理解榜
Top 5
排名模型Elo 评分
反映模型在上传长文档(PDF/Doc等)解析、长文本上下文理解、要点精炼与问答任务上的相对实力积分。
#1AnthropicClaude Opus 5 (High)1520
#2AnthropicClaude Opus 4.61510
#3AnthropicClaude Opus 4.6 (High)1506
#4AnthropicClaude Fable 51504
#5AnthropicClaude Opus 4.71498
查看完整榜单
文生图画质榜
Top 5
排名模型Elo 评分
反映图像生成模型在对齐用户提示词、画面细节清晰度以及视觉美学设计上的相对实力积分。
#1OpenAIGPT Image 2 (medium)1382
#2Microsoft AIMai Image 2.61332
#3SpaceXAIGrok Imagine Image 2.0 (low)1315
#4ReveReve 2.11301
#5MetaMuse Image1279
查看完整榜单
文生视频榜
Top 5
排名模型Elo 评分
反映视频生成模型在生成画面的物理真实感、动作流畅度、时间相干性以及画质清晰度上的相对实力积分。
#1GoogleGemini Omni 1.1 Flash1515
#2GoogleGemini Omni Flash1511
#3AlibabaWan 3.01494
#4Black Forest LabsFlux 3 Video1494
#5SpaceXAIGrok Imagine Video 1.5 (Agent)1491
查看完整榜单

最新文章

查看全部 →
DeepSeek V4 Pro 正式版深度解析:工程闭环跃升、榜单性能对齐与中美 AI 商业化分水岭
2026-08-16

DeepSeek V4 Pro 正式版深度解析:工程闭环跃升、榜单性能对齐与中美 AI 商业化分水岭

历经四个月的技术沉淀,DeepSeek V4 Pro 正式版全面上线。本文结合 LMSYS Arena 与 Artificial Analysis 最新榜单实测,深度剖析其从“长文本阅读器”向“独立交付工程师”的工程跃迁(DeepSWE 62.7、思考强度分级控制与原生 Responses API)、与头部中端旗舰的性能对齐与价格对比,并从全球 AI 营收走势与中美商业模式切入,透视其动态峰谷计费与 Harness 基础设施战略背后的商业逻辑。

Gemini 3.7 Flash 上线与 3.5 Pro 难产之谜:榜单实测、人事地震与 Gemini 4 决战
2026-08-14

Gemini 3.7 Flash 上线与 3.5 Pro 难产之谜:榜单实测、人事地震与 Gemini 4 决战

Google 在推出 3.6 Flash 仅三周后火速上线 Gemini 3.7 Flash,而原定 6 月推送的旗舰 3.5 Pro 至今依然跳票。本文结合 LMSYS 与 Artificial Analysis 最新榜单实测,深度剖析 Pro 难产背后的技术瓶颈、高层人事海啸与全力押注 Gemini 4 的战时转型。

MiniMax H3 发布:视频编辑双榜第一,原生音画同步 + 33B 权重开放
2026-08-13

MiniMax H3 发布:视频编辑双榜第一,原生音画同步 + 33B 权重开放

MiniMax 在 WAIC 之后发布旗舰视频生成大模型 MiniMax H3(海螺 Hailuo 3):Arena 图生视频、视频编辑双榜第一,Artificial Analysis 视频编辑同样登顶,33B 基础模型权重开放。