大模型实时排行榜 · 聚模合

汇集大模型评测与真实使用记录,提供能力榜单、模型实测、API 价格与选型参考。

  • 多维能力榜单
  • 真实模型实测
  • 价格与用量对比

关注头部变化与新模型

榜单综评

全部榜单
模型用量 前五换位Step 5 Preview由第 10 名升至第 2 名。这张榜最醒目的反差,是 DeepSeek V4.1 Flash 不只拿下当日第一,5.65 万亿 tokens 还是 Step 5 Preview 的 2.18 倍;但看 30 天累计,它又是第二名的近 30 倍,日榜和月榜像在讲两种故事。
前五名当日 tokens
  1. 2Step 5 Preview2.59 万亿
  2. 3GLM-5.3-Flash2.01 万亿
  3. 4MiMo-V2.6-Flash1.76 万亿
  4. 5other1.67 万亿
查看完整榜单与点评
多模态能力 新进前十Claude Opus 5.5新进展示范围,排名第 9。Anthropic在这张榜单里最像“常驻嘉宾”:前十占4席,前二十占7席;但榜首由Claude Fable 5拿下,第二名却是阿里Qwen3.8 Max,领先第三名Claude Opus 4.6仅2分。另一处反差是Meta的Muse Spark系列,三个版本都挤进前十。
国产模型能力 前十变化MiMo-V2.5-Pro由第 11 名升至第 10 名。这份汇总最鲜明的反差是:设计类不是处处由同一家领跑。网页开发、UI 组件和 3D 榜的分数与名次完全一致,Kimi K3以85.93分居首;但SVG榜里第二至第四名都被GLM拿下,ASCII画则换成Qwen3.8 Max领跑。

国内 AI 编程榜 · 汇总页中的一个子榜

前五名分
  1. 1GLM-5.370.76
  2. 2Kimi K367.03
查看完整榜单与点评

最新资讯与实测

全部文章
新我用了三周免费的 Space Bunny,现在急着想订阅

Space Bunny(太空兔)是谁家的?没人知道 —— 这正是问题所在。三周真实开发里,它反复推翻自己的结论、认出了我没提名字的实测数据、在我跟别的模型聊天时自己把活干完了。这篇 …

阅读全文
新2块钱,让Claude Haiku 5.5做了个超级马里奥

0.342 美元、19 分钟,Claude Haiku 5.5 从零生成了一个能跑能跳、能吃金币能变大的横版马里奥。附 29 秒实机视频与完整账单,便宜档模型现在到底能干活到什么程 …

阅读全文
新Claude Haiku 5.5 实测:1小时163次请求,花了1.59美元

用 Claude Code 让 Claude Haiku 5.5 改了一小时真实项目:163 次请求、1.5869 美元。16 万 Token 输入为什么一次只花不到 1 美分?缓 …

阅读全文
GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

把同一句话「写一个我的世界demo,web实现」原封不动发给 GPT-6 Astra、DeepSeek V4.1 Flash、GPT-5.6 Terra,不给任何提示词,看谁一次做 …

阅读全文
匿名AI模型三天登顶出圈,真身至今无人知晓

Space Bunny Alpha 匿名上线三天登顶 OpenRouter 调用日榜,供应商栏只写 Stealth。对打 DeepSeek V4.1 Flash 与 GPT-6 …

阅读全文
匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

Space Bunny Alpha 三天冲到 OpenRouter 调用日榜前列,真实身份成谜。本文让它与 DeepSeek V4.1 Flash、GLM 5.3 Flash 在同 …

阅读全文
国内大模型Flash三杰全方位综合对比:GLM-5.3-Flash / DeepSeek-V4-Flash / Qwen3.8-Flash

国内大模型评测与大模型对比:横向全景对比 GLM-5.3-Flash、DeepSeek-V4-Flash、Qwen3.8-Flash 三大国产 Flash 模型的定位、优点、缺点、 …

阅读全文
Qoder 免费账号实测 Qwen3.8-Flash:会下雪的中世纪城堡,0 Credits

用 Qoder 免费账号最高思考档实测 Qwen3.8-Flash:鹈鹕骑自行车与 Three.js 中世纪城堡两题全记录,附 Credits 领取细则。

阅读全文
GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

如视创始人用伽罗华 P4 采集一套住宅的 16 类空间数据(4.3GB),实测 GPT-6 Astra 的实景三维重建能力与边界。

阅读全文
实测字节新模型Seed 2.1 Pro-0915,比想象中的能打多了!

字节Seed 2.1 Pro-0915实测:通用Agent与Coding能力明显进步,实测表现比想象中能打,附真实体验与豆包Seed2.1系列选型参考。

阅读全文

如何看大模型排行榜?

综合能力榜与编程榜关注评测表现,Arena 竞技场反映真人盲测中的偏好,模型用量榜展示实际调用情况。不同榜单回答不同的问题,名次与分数应在同一榜单内比较。选择模型时,再结合实测文章、API 价格与自己的使用场景;各榜更新日期以对应模块和详情页标注为准。