2026-10-10最新大模型编程排行榜
数据更新于 2026-10-10
榜单点评:编程榜最醒目的不是谁夺冠,而是 Anthropic 把前三名全包了,前十也占五席;Google 的 Gemini 4 Argon 排第四,是前五里唯一的非 Anthropic 模型。冠军 Claude Fable 5.1 只领先 Claude Fable 5 0.25 分,兄弟模型之间几乎贴身冲线;不过第二名到第三名差距扩大到 1.82 分。另一处反差是 OpenAI:GPT-6 Astra 排第八,GPT-6.1 Sol 和 GPT-6 却分别落在第十二、第十六。这个榜单里,同厂牌扎堆与自家模型拉开距离,同时发生。
按聚模合对应能力维度评分排序。
价格单位:美元/百万 tokens;OR 有免费变体时展示免费价。输出速度为模型实测参考。
| # | 模型 | 分 | 输入价格 | 输出价格 | OR 输入价 | OR 输出价 | 速度 | 对比 |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 | 85.61 | $10/M | $50/M | $10/M | $50/M | 62 tokens/秒 | |
| 2 | Claude Fable 5 | 85.36 | $10/M | $50/M | $10/M | $50/M | 65 tokens/秒 | |
| 3 | Claude Opus 5 | 83.54 | $5/M | $25/M | $5/M | $25/M | 57 tokens/秒 | |
| 4 | Gemini 4 Argon | 80.54 | $2/M | $10/M | — | — | — | |
| 5 | Claude Opus 5.5 | 79 | $4/M | $20/M | $4/M | $20/M | 97 tokens/秒 | |
| 6 | Muse Spark 1.3 | 78.09 | $1.25/M | $4.25/M | $1.25/M | $4.25/M | 187 tokens/秒 | |
| 7 | Claude Sonnet 5.5 | 75.39 | $2/M | $10/M | $2/M | $10/M | 128 tokens/秒 | |
| 8 | GPT-6 Astra | 73.03 | $10/M | $50/M | $10/M | $50/M | 63 tokens/秒 | |
| 9 | GLM-5.3 | 70.76 | 免费 | 免费 | $0.039/M | $6/M | 75 tokens/秒 | |
| 10 | Grok 4.6 | 67.28 | $2/M | $6/M | $2/M | $6/M | 73 tokens/秒 | |
| 11 | Kimi K3 | 67.03 | $3/M | $15/M | $0.8/M | $13.5/M | 52 tokens/秒 | |
| 12 | GPT-6.1 Sol | 63.73 | $2/M | $10/M | $2/M | $10/M | — | |
| 13 | Qwen3.8 Max | 63.23 | — | — | — | — | 37 tokens/秒 | |
| 14 | MiMo-V2.6-Pro | 62.76 | $0.435/M | $0.87/M | $0.435/M | $0.87/M | 47 tokens/秒 | |
| 15 | DeepSeek V4.1 Flash | 58.95 | $0.3/M | $1.2/M | — | — | 222 tokens/秒 | |
| 16 | GPT-6 Sol | 56.38 | $2/M | $10/M | $2/M | $10/M | — | |
| 17 | Grok 4.7 | 51.16 | $2/M | $6/M | $2/M | $6/M | 92 tokens/秒 |
数据来源:Arena(LMArena) (编程榜经第三方中文镜像获取;聚模合评分排序) · 许可 CC BY 4.0