2026-10-10最新Arena大模型竞技场排行榜
Arena 和评分榜看的是两回事:评分榜比跑分,Arena 比"体感"——匿名两两对战、真人投票换 Elo,跑分容易刷,几万人的投票不好刷。写作、聊天这类没有标准答案的场景,Arena 比任何跑分都更接近真实口碑。
Arena(原 LMArena)采用匿名两两对战 + Elo 评分,由真实用户投票产生排名,是业界公认最接近真实偏好的大模型评测之一。本页聚合其 9 类榜单(文本对话、代码、文档理解、文生图、图片编辑、AI 搜索、文生视频、图生视频、视频编辑),每榜取前 20 名,支持按日期回看与全月分数趋势。
说明:Elo 分数与票数取自 arena.ai 每日公开榜快照;±CI 为 95% 置信区间;「较上期」对比上一个有快照的日期;上游快照缺失的日期自动跳过。数据每日同步更新。
数据更新于 —
文本对话榜点评:Google 的 Gemini 4 Argon以 1525 分登顶,比第二名 Claude Opus 5.5 高 18 分;但领奖台很快变成 Anthropic 的主场:前五席它拿下四席,前十更占五席。Meta 则让 Muse Spark 1.1、1.2、1.3 连同初代一起挤进前十二,像是把家族群直接搬进榜单。分数也并非层层拉开:Claude Opus 5.5 与第三名只差 3 分,榜首之外的缠斗相当紧。另一个小细节是,Claude Opus 4.6、4.7 的 high 档都高于默认档,榜单也提醒我们:同名模型,评测档位不同,名次会变。
代码生成榜点评:Anthropic拿下榜首,也把前十席位中的4席收入囊中;OpenAI则有3席紧随其后,前五几乎被两家包场。Claude Opus 5.5领先GPT-6 Astra 26分,但第二名到第三名只差15分,领先优势没大到能让人提前散场。榜单也有个小反差:Claude Opus 5排第六,低于更新的Opus 5.5;而Google的Gemini 4 Argon暂列第八,阿里Qwen3.8 Max也挤进前十。下半区分差更密,MiMo、Hy和Qwen等模型从第13到第16名只隔几分。
文档理解榜点评:这份榜单几乎被 Anthropic 的 Claude 家族包场:前五席全是 Claude,前十占了七席,连前三也没有外人。冠军 Claude Opus 5 只比 Claude Fable 5.1 高 3 分,头名之争称不上拉开身位;更显眼的是,Anthropic之外,OpenAI 在前十占三席,Meta、Google 则都要到榜单中段才出现。Claude 密集到像开了家族聚会,其他厂商只能见缝插针。
AI 搜索榜点评:GPT-5.6 Sol以1257分登顶,但只比Anthropic的claude-opus-4-6-search高4分,榜首几乎贴身。更显眼的是Anthropic的阵容厚度:前20占7席,前10有4席;OpenAI则拿下第1、3名。版本也没排成整齐队列:Claude Opus 4.8排第12,低于Opus 4.7和4.6;Google的Gemini两款 grounding 模型则守在第9、10名。
文生图榜点评:OpenAI把前三席一口气包圆:gpt-image-2.5-sunburst以1425分登顶,领先同门第二名gpt-image-2.5-flare 27分;不过第二、第三名只差15分,前三内部也并非一骑绝尘。榜首之外,前十席位则由Google和Reve各拿两席,Gemini系还有多款模型排在第十名以后。另一处小看点是同系列版本并非只按新旧排队:Reve 2.1高于2.0,Microsoft AI的mai-image-2.6也排在2.5之前。眼下这张榜,OpenAI负责占领奖台,其他厂商则在前十和中游各有落点。
图像编辑榜点评:OpenAI把前三席一口气包圆,榜首 gpt-image-2.5-sunburst 还领先第二名 gpt-image-2.5-flare 43 分,优势比第二、三名之间的19分差距更醒目。不过,前十并非 OpenAI 独唱:Microsoft AI 和 SpaceXAI 各占两席,Google也有 Nano Banana 2.1 入围。Google的 Gemini 系列虽有多个模型上榜,却主要落在第11名之后;Meta的 muse-image则守住第7。榜单呈现出一个反差:OpenAI拿下领奖台,席位分布却比冠军归属更分散。
文生视频榜点评:Google由gemini-omni-1.1-flash以1516分登顶,老版本gemini-omni-flash仅差3分紧随其后,冠军之争几乎是同门内战。更显眼的是席位分布:Google前20占8席,其中第12至16名连续五席都被Veo 3系列包下;但榜单前三并未被一家垄断,Black Forest Labs的flux-3-video排第三,SpaceXAI的grok-imagine-video-1.5-agent排第四。另一处反差是OpenAI的sora-2-pro列第11,反而高于sora-2的第17名。
图生视频榜点评:MiniMax 的 minimax-h3 以 1495 分登顶,但只领先 Google 的 gemini-omni-1.1-flash 7 分,前三名都在 15 分内,榜首并没有甩开身位。更显眼的是阵容厚度:Google 在前20占7席,字节则把 dreamina-seedance-2.5 和 2.0 一起送进前五。阿里也有 wan3.0 排第三,Alibaba-ATH 的 happyhorse-1.0 排第十。冠军归 MiniMax,榜单的“人海战术”则是 Google 更突出。
视频编辑榜点评:视频编辑榜的前三席被阿里、字节和 MiniMax 各拿一席,冠军争夺尤其紧:Alibaba 的 wan3.0 只比字节 dreamina-seedance-2.5-720p 高 4 分。字节还让 dreamina-seedance-2.0-720p 排在第五,前五占了两席;Google 的 gemini-omni-flash 则夹在两个字节模型之间。榜单后段,KlingAI 的 kling-o3-pro 和 kling-o1-pro 连续占据第八、第九,像是专门把自家席位排成了一对。
Text 对话第一 Gemini 4 Argon(1525 分) · Code 编程第一 Claude Opus 5.5(1814 分)。
本月 Elo 分数走势(最新 Top 10)
文本对话榜 Top 10(2026-10-10,静态备份)
| # | 模型 | 厂商 | Elo | 票数 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Gemini 4 Argon | 1525 | 4892 | ||||||||||
| 2 | Claude Opus 5.5 | Anthropic | 1507 | 6272 | |||||||||
| 3 | Claude Opus 4.62档2 个评测配置(推理档位)
最高与最低档相差 6 Elo | Anthropic | 1504 | 79415 | |||||||||
| 4 | Claude Fable 5 | Anthropic | 1504 | 40026 | |||||||||
| 5 | Claude Opus 4.72档2 个评测配置(推理档位)
最高与最低档相差 7 Elo | Anthropic | 1501 | 65192 | |||||||||
| 6 | Claude Fable 5.1 | Anthropic | 1501 | 13063 | |||||||||
| 7 | Gemini 3.8 Flash | 1497 | 31437 | ||||||||||
| 8 | Muse Spark 1.3 | Meta | 1494 | 14694 | |||||||||
| 9 | Muse Spark 1.2 | Meta | 1492 | 6118 | |||||||||
| 10 | Muse Spark 1.1 | Meta | 1491 | 39847 |
数据来源:Arena(LMArena) · 许可 CC BY 4.0