2026-10-10最新Arena大模型竞技场排行榜

Arena 和评分榜看的是两回事:评分榜比跑分,Arena 比"体感"——匿名两两对战、真人投票换 Elo,跑分容易刷,几万人的投票不好刷。写作、聊天这类没有标准答案的场景,Arena 比任何跑分都更接近真实口碑。

Arena(原 LMArena)采用匿名两两对战 + Elo 评分,由真实用户投票产生排名,是业界公认最接近真实偏好的大模型评测之一。本页聚合其 9 类榜单(文本对话、代码、文档理解、文生图、图片编辑、AI 搜索、文生视频、图生视频、视频编辑),每榜取前 20 名,支持按日期回看与全月分数趋势。

说明:Elo 分数与票数取自 arena.ai 每日公开榜快照;±CI 为 95% 置信区间;「较上期」对比上一个有快照的日期;上游快照缺失的日期自动跳过。数据每日同步更新。

榜单类型
日期

数据更新于 —

文本对话榜点评:Google 的 Gemini 4 Argon以 1525 分登顶,比第二名 Claude Opus 5.5 高 18 分;但领奖台很快变成 Anthropic 的主场:前五席它拿下四席,前十更占五席。Meta 则让 Muse Spark 1.1、1.2、1.3 连同初代一起挤进前十二,像是把家族群直接搬进榜单。分数也并非层层拉开:Claude Opus 5.5 与第三名只差 3 分,榜首之外的缠斗相当紧。另一个小细节是,Claude Opus 4.6、4.7 的 high 档都高于默认档,榜单也提醒我们:同名模型,评测档位不同,名次会变。

Text 对话第一 Gemini 4 Argon(1525 分) · Code 编程第一 Claude Opus 5.5(1814 分)。

本月 Elo 分数走势(最新 Top 10)

文本对话榜 Top 10(2026-10-10,静态备份)
#模型厂商Elo票数
1Gemini 4 ArgonGoogle15254892
2Claude Opus 5.5Anthropic15076272
3Claude Opus 4.6
2档

2 个评测配置(推理档位)

配置Elo票数
high150479,415
默认149884,095

最高与最低档相差 6 Elo

Anthropic150479415
4Claude Fable 5Anthropic150440026
5Claude Opus 4.7
2档

2 个评测配置(推理档位)

配置Elo票数
high150165,192
默认149466,315

最高与最低档相差 7 Elo

Anthropic150165192
6Claude Fable 5.1Anthropic150113063
7Gemini 3.8 FlashGoogle149731437
8Muse Spark 1.3Meta149414694
9Muse Spark 1.2Meta14926118
10Muse Spark 1.1Meta149139847

数据来源:Arena(LMArena) · 许可 CC BY 4.0