2026-10-10最新大模型排行榜
综合评分榜点评:这张榜单像是 Anthropic 的主场:Claude 占前五席中的四席、前二十席中的六席;OpenAI 则有五席进前二十,但只有一个进入前三。更反常的是,版本号没能预测名次:Gemini 3.7 Flash 排在 3.8 Flash 前面,Claude Opus 4.7 也高于 4.8。Google 的两款 Gemini 都在前二十,却没有进入前十。新版、旧版和厂商席位,几条线索摆在一起,比单看榜首更耐琢磨。
编程榜点评:编程榜最醒目的不是谁夺冠,而是 Anthropic 把前三名全包了,前十也占五席;Google 的 Gemini 4 Argon 排第四,是前五里唯一的非 Anthropic 模型。冠军 Claude Fable 5.1 只领先 Claude Fable 5 0.25 分,兄弟模型之间几乎贴身冲线;不过第二名到第三名差距扩大到 1.82 分。另一处反差是 OpenAI:GPT-6 Astra 排第八,GPT-6.1 Sol 和 GPT-6 却分别落在第十二、第十六。这个榜单里,同厂牌扎堆与自家模型拉开距离,同时发生。
文档理解榜点评:Anthropic拿下榜首,也在前十占了4席;OpenAI则更像是“榜单常驻户”,前五有3席、前十有3席。最醒目的反差是,Claude Fable 5.1只以0.95分领先GPT-6 Astra,冠军差距很薄;但第二名之后,GPT-6 Astra到Meta的Muse Spark 1.3已拉开6分。另一处细节是,Claude Opus 5排第6,低于前代Fable 5.1,却又高过多个Opus旧版本;同系列模型并没有整齐地按版本号排队。谷歌的Gemini 3.6 Flash卡在第9,和Meta的Muse Spark 1.1只差0.14分。
多模态榜点评:Anthropic在这张榜单里最像“常驻嘉宾”:前十占4席,前二十占7席;但榜首由Claude Fable 5拿下,第二名却是阿里Qwen3.8 Max,领先第三名Claude Opus 4.6仅2分。另一处反差是Meta的Muse Spark系列,三个版本都挤进前十。榜单前列分差很紧,Google的Gemini 3.7 Flash排第五,与第六名GPT-6.1 Sol也只差3分,冠军之外几乎步步贴身。
国产游戏开发榜点评:Kimi K3以85.93分拿下榜首,领先小米 MiMo-V2.6-Pro 3.77分;但榜单最醒目的不是冠军,而是智谱 AI 的密集阵型:前十占5席,GLM-5.3、GLM-5.3-Flash、GLM-5.2连续排在第4至第6名。阿里通义、月之暗面和小米也都有模型进入前十,不过第二、第三名只差1.82分,前三的座次并没拉开太大距离。首名属于Kimi,前十席位则是GLM家族的主场。
国产编程榜点评:智谱 AI 的 GLM-5.3 以 70.76 分登顶,但榜单更醒目的结构是:智谱在前 20 占 6 席,GLM-5.3、Flash、5.2、5、5.1、4.7 一路排开,像是把自家型号开成了编队。月之暗面则由 Kimi K3 拿下第二,和榜首相差 3.73 分;第三名 Step 3.7 Flash 与第四名 Qwen3.8 Max 仅差 0.12 分,前列座次咬得很紧。另一处反差是 GLM-5.3 领跑,旧款 GLM-5 却排在 GLM-5.2 之后,型号越新,名次并非一路向上。
调用量周榜点评:DeepSeek V4.1 Flash以37.60万亿 tokens登顶,达到第二名 space-bunny-alpha 的2.22倍,榜首和亚军之间几乎隔着一道鸿沟。前排则不是一家独大:智谱的GLM-5.3-Flash排第三,DeepSeek V4 Flash 0731也进前五;往前十看,智谱、DeepSeek、OpenAI、Anthropic等各有模型入围。Google的Gemini 3.8 Flash排第12,前十暂时没有Google模型。另一个小反差是,DeepSeek两个入榜版本都在前五,而Anthropic的Claude Opus 5.5排第9,Claude Sonnet 5.5和Haiku 5.5则在后十。
国产调用量周榜点评:这份调用量周榜最醒目的不是榜首易主,而是 DeepSeek V4.1 Flash 把身后的队伍甩开了:37.60 万亿 tokens,是第二名智谱 GLM-5.3-Flash 的 3.36 倍。席位分布则是另一番景象:智谱在前九占三席,DeepSeek 和小米各占两席。DeepSeek V4 Flash 0731也排到第四,和榜首同厂但相差明显;GLM-5.3-Flash、MiMo-V2.6-Flash紧贴第二、第三,榜单前段并非一家独大。
数据更新于 2026-10-10
展开查看全部 8 个榜单的 Top10 表格
综合评分榜
| 排名 | 模型 | 分 | 对比 |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 86.5 | |
| 2 | Claude Fable 5.1 | 84.77 | |
| 3 | GPT-6.1 Sol | 81.69 | |
| 4 | Claude Sonnet 5.5 | 80.01 | |
| 5 | Claude Opus 5 | 79.84 | |
| 6 | GPT-6 Astra | 79.27 | |
| 7 | Muse Spark 1.3 | 79.03 | |
| 8 | GPT-5.6 Sol | 76.41 | |
| 9 | MiMo-V2.6-Pro | 74.38 | |
| 10 | Kimi K3 | 73.84 |
编程榜
| 排名 | 模型 | 分 | 对比 |
|---|---|---|---|
| 1 | Claude Fable 5.1 | 85.61 | |
| 2 | Claude Fable 5 | 85.36 | |
| 3 | Claude Opus 5 | 83.54 | |
| 4 | Gemini 4 Argon | 80.54 | |
| 5 | Claude Opus 5.5 | 79 | |
| 6 | Muse Spark 1.3 | 78.09 | |
| 7 | Claude Sonnet 5.5 | 75.39 | |
| 8 | GPT-6 Astra | 73.03 | |
| 9 | GLM-5.3 | 70.76 | |
| 10 | Grok 4.6 | 67.28 |
文档理解榜
| 排名 | 模型 | 分 | 对比 |
|---|---|---|---|
| 1 | Claude Fable 5.1 | 86.4 | |
| 2 | GPT-6 Astra | 85.45 | |
| 3 | Muse Spark 1.3 | 79.45 | |
| 4 | GPT-5.6 Sol | 77.85 | |
| 5 | GPT-5.5 | 75.59 | |
| 6 | Claude Opus 5 | 71.16 | |
| 7 | Claude Opus 4.6 | 69.76 | |
| 8 | Claude Opus 4.8 | 69.23 | |
| 9 | Gemini 3.6 Flash | 68.15 | |
| 10 | Muse Spark 1.1 | 68.01 |
多模态榜
| 排名 | 模型 | Elo | 对比 |
|---|---|---|---|
| 1 | Claude Fable 5 | 1308 | |
| 2 | Qwen3.8 Max | 1301 | |
| 3 | Claude Opus 4.6 | 1299 | |
| 4 | Claude Opus 4.7 | 1298 | |
| 5 | Gemini 3.7 Flash | 1297 | |
| 6↑2 | GPT-6.1 Sol | 1294 | |
| 7↓1 | Muse Spark | 1294 | |
| 8↓1 | Muse Spark 1.2 | 1293 | |
| 9新 | Claude Opus 5.5 | 1293 | |
| 10 | Muse Spark 1.3 | 1290 |
国产游戏开发榜
| 排名 | 模型 | 分 | 对比 |
|---|---|---|---|
| 1 | Kimi K3 | 85.93 | |
| 2 | MiMo-V2.6-Pro | 82.16 | |
| 3 | Qwen3.8 Max | 80.34 | |
| 4 | GLM-5.3 | 78.33 | |
| 5 | GLM-5.3-Flash | 76.3 | |
| 6 | GLM-5.2 | 74.07 | |
| 7 | Qwen3.7 Max | 69.71 | |
| 8 | GLM-5-Turbo | 67.26 | |
| 9 | GLM-5.1 | 66.72 | |
| 10 | Kimi K2.6 | 64.1 |
国产编程榜
| 排名 | 模型 | 分 | 对比 |
|---|---|---|---|
| 1 | GLM-5.3 | 70.76 | |
| 2 | Kimi K3 | 67.03 | |
| 3 | Step 3.7 Flash | 63.35 | |
| 4 | Qwen3.8 Max | 63.23 | |
| 5 | MiMo-V2.6-Pro | 62.76 | |
| 6 | Qwen3.7 Max | 62.3 | |
| 7 | GLM-5.3-Flash | 61.57 | |
| 8 | Kimi K2.6 | 59.09 | |
| 9 | GLM-5.2 | 58.99 | |
| 10↑1 | MiMo-V2.5-Pro | 58.49 |
调用量周榜
| 排名 | 模型 | tokens | 对比 |
|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | 37.60 万亿 | |
| 2 | space-bunny-alpha | 16.95 万亿 | — |
| 3 | GLM-5.3-Flash | 11.20 万亿 | |
| 4 | MiMo-V2.6-Flash | 10.93 万亿 | |
| 5 | DeepSeek V4 Flash 0731 | 8.30 万亿 | |
| 6 | Hy4 preview | 7.96 万亿 | |
| 7 | GPT-6 Luna | 6.94 万亿 | |
| 8 | Nemotron 3 Ultra 550B A55B (thinking) | 6.38 万亿 | — |
| 9 | Claude Opus 5.5 | 4.32 万亿 | |
| 10↑1 | GLM-5.3 | 3.42 万亿 |
国产调用量周榜
| 排名 | 模型 | tokens | 对比 |
|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | 37.60 万亿 | |
| 2 | GLM-5.3-Flash | 11.20 万亿 | |
| 3 | MiMo-V2.6-Flash | 10.93 万亿 | |
| 4 | DeepSeek V4 Flash 0731 | 8.30 万亿 | |
| 5 | Hy4 preview | 7.96 万亿 | |
| 6 | GLM-5.3 | 3.42 万亿 | |
| 7 | Kimi K3 | 1.97 万亿 | |
| 8 | GLM-5.2 | 7971.4 亿 | |
| 9 | MiMo-V2.6-Pro | 3406.8 亿 |