2026-10-10最新大模型文档理解排行榜
数据更新于 2026-10-10
榜单点评:Anthropic拿下榜首,也在前十占了4席;OpenAI则更像是“榜单常驻户”,前五有3席、前十有3席。最醒目的反差是,Claude Fable 5.1只以0.95分领先GPT-6 Astra,冠军差距很薄;但第二名之后,GPT-6 Astra到Meta的Muse Spark 1.3已拉开6分。另一处细节是,Claude Opus 5排第6,低于前代Fable 5.1,却又高过多个Opus旧版本;同系列模型并没有整齐地按版本号排队。谷歌的Gemini 3.6 Flash卡在第9,和Meta的Muse Spark 1.1只差0.14分。
按文本维度评分排序,作为文档理解的参考。
价格单位:美元/百万 tokens;OR 有免费变体时展示免费价。输出速度为模型实测参考。
| # | 模型 | 分 | 输入价格 | 输出价格 | OR 输入价 | OR 输出价 | 速度 | 对比 |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 | 86.4 | $10/M | $50/M | $10/M | $50/M | 62 tokens/秒 | |
| 2 | GPT-6 Astra | 85.45 | $10/M | $50/M | $10/M | $50/M | 63 tokens/秒 | |
| 3 | Muse Spark 1.3 | 79.45 | $1.25/M | $4.25/M | $1.25/M | $4.25/M | 187 tokens/秒 | |
| 4 | GPT-5.6 Sol | 77.85 | $4/M | $20/M | $2/M | $10/M | 97 tokens/秒 | |
| 5 | GPT-5.5 | 75.59 | $5/M | $30/M | $5/M | $30/M | 104 tokens/秒 | |
| 6 | Claude Opus 5 | 71.16 | $5/M | $25/M | $5/M | $25/M | 57 tokens/秒 | |
| 7 | Claude Opus 4.6 | 69.76 | $5/M | $25/M | $5/M | $25/M | 42 tokens/秒 | |
| 8 | Claude Opus 4.8 | 69.23 | $5/M | $25/M | $5/M | $25/M | 64 tokens/秒 | |
| 9 | Gemini 3.6 Flash | 68.15 | $0.75/M | $3.75/M | $0.75/M | $3.75/M | 197 tokens/秒 | |
| 10 | Muse Spark 1.1 | 68.01 | — | — | $1.25/M | $4.25/M | 217 tokens/秒 | |
| 11 | Gemini 3.5 Flash | 67.7 | $1.5/M | $9/M | $1.5/M | $9/M | 213 tokens/秒 | |
| 12 | Claude Opus 4.7 | 67.09 | $5/M | $25/M | $5/M | $25/M | 50 tokens/秒 | |
| 13 | Grok 4.6 | 62.8 | $2/M | $6/M | $2/M | $6/M | 73 tokens/秒 | |
| 14 | Claude Opus 4.5 | 60.57 | $5/M | $25/M | $5/M | $25/M | 50 tokens/秒 | |
| 15 | GPT-5.6 Terra | 56.85 | $2/M | $12/M | $2/M | $12/M | — | |
| 16 | Claude Sonnet 4.6 | 56.46 | $3/M | $15/M | $3/M | $15/M | 49 tokens/秒 | |
| 17 | Claude Sonnet 5 | 47.91 | $2/M | $10/M | $2/M | $10/M | 86 tokens/秒 | |
| 18 | GPT-5.6 Luna | 40.57 | $0.2/M | $1.2/M | $0.2/M | $1.2/M | — | |
| 19 | GPT-5.4 | 39.97 | $2.5/M | $15/M | $2.5/M | $15/M | 101 tokens/秒 |
数据来源:Arena(LMArena) (聚模合评分排序) · 许可 CC BY 4.0