2026-10-10最新大模型排行榜

综合评分榜点评:这张榜单像是 Anthropic 的主场:Claude 占前五席中的四席、前二十席中的六席;OpenAI 则有五席进前二十,但只有一个进入前三。更反常的是,版本号没能预测名次:Gemini 3.7 Flash 排在 3.8 Flash 前面,Claude Opus 4.7 也高于 4.8。Google 的两款 Gemini 都在前二十,却没有进入前十。新版、旧版和厂商席位,几条线索摆在一起,比单看榜首更耐琢磨。

榜单类型

数据更新于 2026-10-10

展开查看全部 8 个榜单的 Top10 表格

综合评分榜

排名模型分对比
1Claude Opus 5.586.5
2Claude Fable 5.184.77
3GPT-6.1 Sol81.69
4Claude Sonnet 5.580.01
5Claude Opus 579.84
6GPT-6 Astra79.27
7Muse Spark 1.379.03
8GPT-5.6 Sol76.41
9MiMo-V2.6-Pro74.38
10Kimi K373.84

编程榜

排名模型分对比
1Claude Fable 5.185.61
2Claude Fable 585.36
3Claude Opus 583.54
4Gemini 4 Argon80.54
5Claude Opus 5.579
6Muse Spark 1.378.09
7Claude Sonnet 5.575.39
8GPT-6 Astra73.03
9GLM-5.370.76
10Grok 4.667.28

文档理解榜

排名模型分对比
1Claude Fable 5.186.4
2GPT-6 Astra85.45
3Muse Spark 1.379.45
4GPT-5.6 Sol77.85
5GPT-5.575.59
6Claude Opus 571.16
7Claude Opus 4.669.76
8Claude Opus 4.869.23
9Gemini 3.6 Flash68.15
10Muse Spark 1.168.01

多模态榜

排名模型Elo对比
1Claude Fable 51308
2Qwen3.8 Max1301
3Claude Opus 4.61299
4Claude Opus 4.71298
5Gemini 3.7 Flash1297
6↑2GPT-6.1 Sol1294
7↓1Muse Spark1294
8↓1Muse Spark 1.21293
9新Claude Opus 5.51293
10Muse Spark 1.31290

国产游戏开发榜

排名模型分对比
1Kimi K385.93
2MiMo-V2.6-Pro82.16
3Qwen3.8 Max80.34
4GLM-5.378.33
5GLM-5.3-Flash76.3
6GLM-5.274.07
7Qwen3.7 Max69.71
8GLM-5-Turbo67.26
9GLM-5.166.72
10Kimi K2.664.1

国产编程榜

排名模型分对比
1GLM-5.370.76
2Kimi K367.03
3Step 3.7 Flash63.35
4Qwen3.8 Max63.23
5MiMo-V2.6-Pro62.76
6Qwen3.7 Max62.3
7GLM-5.3-Flash61.57
8Kimi K2.659.09
9GLM-5.258.99
10↑1MiMo-V2.5-Pro58.49

调用量周榜

排名模型tokens对比
1DeepSeek V4.1 Flash37.60 万亿
2space-bunny-alpha16.95 万亿—
3GLM-5.3-Flash11.20 万亿
4MiMo-V2.6-Flash10.93 万亿
5DeepSeek V4 Flash 07318.30 万亿
6Hy4 preview7.96 万亿
7GPT-6 Luna6.94 万亿
8Nemotron 3 Ultra 550B A55B (thinking)6.38 万亿—
9Claude Opus 5.54.32 万亿
10↑1GLM-5.33.42 万亿

国产调用量周榜

排名模型tokens对比
1DeepSeek V4.1 Flash37.60 万亿
2GLM-5.3-Flash11.20 万亿
3MiMo-V2.6-Flash10.93 万亿
4DeepSeek V4 Flash 07318.30 万亿
5Hy4 preview7.96 万亿
6GLM-5.33.42 万亿
7Kimi K31.97 万亿
8GLM-5.27971.4 亿
9MiMo-V2.6-Pro3406.8 亿