2026-10-10最新大模型多模态理解排行榜

数据更新于 2026-10-10

榜单点评:Anthropic在这张榜单里最像“常驻嘉宾”:前十占4席,前二十占7席;但榜首由Claude Fable 5拿下,第二名却是阿里Qwen3.8 Max,领先第三名Claude Opus 4.6仅2分。另一处反差是Meta的Muse Spark系列,三个版本都挤进前十。榜单前列分差很紧,Google的Gemini 3.7 Flash排第五,与第六名GPT-6.1 Sol也只差3分,冠军之外几乎步步贴身。

价格单位:美元/百万 tokens;OR 有免费变体时展示免费价。输出速度为模型实测参考。

#模型Elo输入价格输出价格OR 输入价OR 输出价速度对比
1Claude Fable 51308$10/M$50/M$10/M$50/M65 tokens/秒
2Qwen3.8 Max1301————37 tokens/秒
3Claude Opus 4.6
2档

2 个评测配置(推理档位)

配置Elo票数
high129922,304
默认129426,853

最高与最低档相差 5 Elo

1299$5/M$25/M$5/M$25/M42 tokens/秒
4Claude Opus 4.7
2档

2 个评测配置(推理档位)

配置Elo票数
默认129823,165
high129822,733
1298$5/M$25/M$5/M$25/M50 tokens/秒
5Gemini 3.7 Flash1297$0.75/M$3.75/M$0.75/M$3.75/M284 tokens/秒
6↑2GPT-6.1 Sol1294$2/M$10/M$2/M$10/M—
7↓1Muse Spark1294——$1.25/M$4.25/M—
8↓1Muse Spark 1.21293$1.25/M$4.25/M$1.25/M$4.25/M154 tokens/秒
9新Claude Opus 5.51293$4/M$20/M$4/M$20/M97 tokens/秒
10Muse Spark 1.3
2档

2 个评测配置(推理档位)

配置Elo票数
max12904,550
xhigh12864,077

最高与最低档相差 4 Elo

1290$1.25/M$4.25/M$1.25/M$4.25/M187 tokens/秒
11Gemini 3 Pro1289$2/M$12/M$1.25/M$10/M109 tokens/秒
12↓3Gemini 3.8 Flash1289$0.75/M$3.75/M$0.75/M$3.75/M242 tokens/秒
13↓1Claude Opus 51287$5/M$25/M$5/M$25/M57 tokens/秒
14↑2GPT-5.6 Sol1287$4/M$20/M$2/M$10/M97 tokens/秒
15↓2Claude Fable 5.11286$10/M$50/M$10/M$50/M62 tokens/秒
16↑2GPT-6 Astra1286$10/M$50/M$10/M$50/M63 tokens/秒
17↓3GPT-5.5
2档

2 个评测配置(推理档位)

配置Elo票数
默认128627,993
high128126,281

最高与最低档相差 5 Elo

1286$5/M$30/M$5/M$30/M104 tokens/秒
18↓3Claude Opus 4.8
2档

2 个评测配置(推理档位)

配置Elo票数
high128618,341
默认127918,852

最高与最低档相差 7 Elo

1286$5/M$25/M$5/M$25/M64 tokens/秒
19↓2Gemini 3.5 Flash
2档

2 个评测配置(推理档位)

配置Elo票数
medium128513,180
high128413,103

最高与最低档相差 1 Elo

1285$1.5/M$9/M$1.5/M$9/M213 tokens/秒
20↓1GPT-5.4
2档

2 个评测配置(推理档位)

配置Elo票数
high128529,881
默认127922,832

最高与最低档相差 6 Elo

1285$2.5/M$15/M$2.5/M$15/M101 tokens/秒

数据来源:Arena(LMArena) · 许可 CC BY 4.0