一、LMArena 是什么?

LMArena(Large Model Arena,前身为 Chatbot Arena)是由知名 AI 研究组织 LMSYS Org(由 UC 伯克利等高校发起)建立的全球大模型开放式评估基准

作为非营利性公共平台,它充当了“AI 领域的权威公证处”,旨在摒弃厂商自嗨式宣传,为全球开发者与企业提供中立、贴近真实应用场景的大模型能力参考。

二、LLM Arena 排行榜是如何运作的?

LLM Arena 抛弃了传统静态试卷跑分,采用了“真实盲测 + 众包投票 + Elo 算法”的运行机制:

  1. 匿名盲测:用户输入任意问题,系统随机分发给隐藏名称的 Model A 与 Model B 同台回答。
  2. 人类投票:用户根据回答质量进行匿名“二选一”(或选择平局/两者皆差)。
  3. 揭晓身份:提交投票后揭晓模型真实名称,并将胜负同步至后台。
  4. Elo 动态积分:采用竞技游戏排位赛式的 Elo 算法,击败强敌加高分、输给弱者扣多分,实时计算排名。

这种由海量真实用户测出来的 Elo 排行榜,最真实地反映了模型的实战战力。

三、为什么 LMArena 被认为是目前最权威的大模型排行榜?

在 AI 领域排行榜众多的今天,LMArena 能成为公认的“终极裁判”,关键在于三点:

  1. 彻底防刷榜:传统跑分(如 MMLU)容易发生“训练集污染”或针对性刷分。LMArena 采用随机盲测与实时提问,模型无题可刷
  2. Elo 动态战力:借鉴竞技体育算法,根据胜负对手的强弱动态更新积分,精确反映真实相对实力。
  3. 发布前匿名试水:全球顶尖 AI 厂商(如 OpenAI、Anthropic、Google、阿里等)在发布新旗舰前,普遍会使用神秘的匿名代号(如曾轰动 AI 圈的 im-a-good-gpt2-chatbotsus-column-r 等)悄悄空降竞技场测水温,将 LMArena 的真实胜率作为产品发布的终极评估指标。

四、2026 年 8 月全球大模型排行榜前十名

在 LMArena 排行榜中,全球 AI 梯队格局保持实时动态更新。在众多评估维度中,广大开发者与企业用户最关注的莫过于文本对话Agent 智能体两大核心榜单。

1. 文本对话榜

文本对话榜是 LMArena 最经典、参与度最高的榜单,重点考察大模型在日常问答、复杂逻辑推理、文本创作及多轮对话中的综合实战体验,直观反映了各大模型的“通用大脑”智商水平。

正在生成最新 文本对话 榜单图表...

2. Agent 智能体榜

Agent 榜则代表了大模型前沿能力的“实操上限”,专门评估模型在复杂工作流规划、工具调用(Function Calling)、自动化代码执行及系统接管方面的智能化能力,是企业构建 AI Agent 选型时的核心参考。

正在生成最新 Agent 榜单图表...

五、LMArena 支持哪些细分榜单?

除了全局综合排名外,本站基于 LMArena 权威评测数据,细分并支持了以下 11 大核心子榜单。你可以点击对应链接直达查看该领域的最新梯队排名:

六、如何在国内直接体验 LMArena 盲测与对战?

受限于网络环境,国内用户直接访问 LMSYS 官网常常受阻。你可以直接访问国内直连镜像站:arena.atease.dev

免翻墙极速访问:国内网络秒开,带来零延迟的流畅查询体验。
每 2 小时实时更新:自动同步 LMSYS 官方最新盲测数据,每 2 小时刷新一次全球大模型战力榜。
涵盖 11 大细分榜单:一站式查阅文本、Agent、代码、多模态等全方位模型排名。