选好模型,省心又省钱

在茫茫模海中找到那颗你专属的模星。

  • 139 个模型有实测数据
  • 用户真实体验
  • AI 智能推荐
① 场景:

推荐排序:场景分数 → 用户口碑(真实好评)→ 价格;仅列出有第三方评测数据的模型

模型场景编程智能体推理通用输入输出上下文对比
Gemini 4 Argon 谷歌编程通用对话1678——1525$2/M$10/M未公布
Claude Opus 5.5 Anthropic编程通用对话181474.3%90.2%1507$4/M$20/M1M
Claude Opus 4.6 Anthropic 👍 写作聊天最佳 · 疑难 bug 克星 · 编码成熟够用通用对话看图 / 文档理解1546——1504$5/M$25/M1M
Claude Fable 5.1 Anthropic 👍 多代理编排 · 工具/MCP 协调 · 自适应推理编程通用对话174579.2%89.9%1501$10/M$50/M1M
Claude Opus 4.7 Anthropic 👍 出货提速明显 · 遵循既有代码风格 · 思考模式排名靠前通用对话看图 / 文档理解1558——1501$5/M$25/M1M
Gemini 3.8 Flash 谷歌 👍 速度最快 · 价格最低 · 快速迭代顺手通用对话看图 / 文档理解158371.3%95.6%1497$0.75/M$3.75/M1M
Muse Spark 1.3 Meta 👍 DeepSWE 75.4% · 编排能力强 · 与 1.1 同价编程通用对话1656——1494$1.25/M$4.25/M1M
Muse Spark 1.2 Meta通用对话看图 / 文档理解1532——1492$1.25/M$4.25/M1M
Muse Spark 1.1 Meta 👍 工具调用编排 · 准确率高 · 比 Grok 便宜通用对话1542——1491——1M
Claude Opus 5 Anthropic 👍 写作质量最佳 · 长程 Agent 首选 · 编码基准顶尖编程通用对话169278.6%87.5%1490$5/M$25/M未公布
Muse Spark Meta通用对话看图 / 文档理解———1489——262K
Kimi K3 月之暗面 👍 性价比极高 · 单发最可靠 · 前端能力强编程通用对话165571.9%91.9%1488$3/M$15/M1M
Gemini 3.1 Pro 谷歌 👍 工程能力强 · 架构问题求解通用对话1447——1487$2/M$12/M1M
Gemini 3.7 Flash 谷歌 👍 速度快效率高 · GPQA 93.9% · 价格回到合理档通用对话看图 / 文档理解159278.5%93.9%1486$0.75/M$3.75/M1M
Gemini 3 Pro 谷歌 👍 推理分数顶尖 · Antigravity 搭档 · 企业场景全面通用对话看图 / 文档理解1440——1485$2/M$12/M2M
GPT-5.6 Sol OpenAI 👍 编码代理指数高 · 数学推理顶尖 · 输出 token 效率高通用对话看图 / 文档理解—74.7%92.1%1485$4/M$20/M1.05M
GPT-6.1 Sol OpenAI编程通用对话175770.0%94.4%1484$2/M$10/M1.05M
Gemini 3.6 Flash 谷歌 👍 小项目出活快 · 多模态集成顺通用对话看图 / 文档理解153874.7%92.7%1482$0.75/M$3.75/M1M
GPT-5.5 OpenAI 👍 行为稳定可预期 · 先澄清省 token · 老用户首选主力通用对话看图 / 文档理解—75.1%93.7%1482$5/M$30/M1M
Claude Opus 4.8 Anthropic 👍 写作风格讨喜 · 图像理解更强 · 硬件电路也能打通用对话看图 / 文档理解1556——1481$5/M$25/M1M
MiMo-V2.6-Pro 小米编程通用对话163071.7%88.6%1480$0.435/M$0.87/M1M
GLM-5.3 智谱 AI 👍 生产可用口碑 · 自部署友好 · 研究开放编程通用对话162276.1%85.4%1478免费免费1M
Gemini 3.5 Flash 谷歌 👍 视觉基准屠榜 · 便宜易扩量 · 生产验证能赚钱通用对话看图 / 文档理解150973.1%92.6%1478$1.5/M$9/M1M
Claude Sonnet 5.5 Anthropic编程通用对话177374.7%92.1%1476$2/M$10/M1M
DeepSeek V4.1 Flash 深度求索 👍 速度冠军 · 极致便宜 · 善抓 edge case编程通用对话161976.2%88.9%1475$0.3/M$1.2/M1M
GPT-6 Astra OpenAI 👍 规划评审最强 · Manager Loop 多代理 · 3D/数据分析跃迁编程通用对话178868.0%94.4%1475$10/M$50/M1.05M
GLM-5.2 智谱 AI 👍 教学质量第一 · 不幻觉 · 曾被选作默认模型编程通用对话160372.7%85.2%1475$1.4/M$4.4/M1M
GLM-5.3-Flash 智谱 AI 👍 强于 DS4.1F 且半价 · 租用成本极低 · 工作主力口碑编程通用对话161075.6%90.9%1475免费免费1M
GPT-5.4 OpenAI通用对话看图 / 文档理解139975.3%90.3%1475$2.5/M$15/M1.05M
Qwen3.7 Max 阿里通义 👍 综合分数在线 · 数学证明可用 · 托管稳定通用对话数学 / 数据分析151572.0%90.9%1475——1M
Gemini 3 Flash 谷歌 👍 便宜到离谱 · 量大管饱 · 预览期口碑封神1439——1473$0.5/M$3/M1M
Claude Sonnet 4.6 Anthropic 👍 写作自然 · 批改评审可靠 · 性价比均衡长文档处理1522——1472$3/M$15/M200K
Grok 4.20 xAI1375——1472$1.25/M$2.5/M2M
Claude Opus 4.5 Anthropic1469——1470$5/M$25/M200K
Grok 4.20 Multi-agent xAI———1470——2M
MiMo-V2.5-Pro 小米147873.6%82.0%1468——1M
GPT-5.6 Terra OpenAI 👍 子代理打工首选 · 单任务成本低 · 修 bug 二遍手靠谱长文档处理—73.1%88.8%1466$2/M$12/M1.05M
Grok 4.5 xAI1553——1466$2/M$6/M500K
Grok 4.1 xAI1214——1465——1M
GLM-5.1 智谱 AI 👍 曾是日常主力 · 隐身测试口碑好Agent 自动化150875.4%80.9%1464$1.4/M$4.4/M203K
Claude Sonnet 5 Anthropic 👍 日常编码主力 · 省 token · 遵循项目规范Agent 自动化154175.3%83.5%1461$2/M$10/M1M
DeepSeek V4 Pro 0813 深度求索 👍 大上下文代码强 · 价格仅 K3 1/10 · 384K 最大输出数学 / 数据分析Agent 自动化144677.0%89.8%1458$1.32/M$3.96/M1M
GLM-5 智谱 AI 👍 平替 Claude 无误拒 · Bedrock 可托管Agent 自动化143477.0%75.4%1458$1/M$3.2/M200K
GPT-5.1 OpenAIAgent 自动化139577.1%86.4%1456$1.25/M$10/M200K
GPT-6 Sol OpenAI编程数学 / 数据分析168769.3%91.9%1456$2/M$10/M1.05M
Qwen3.7 Plus 阿里通义 👍 视觉任务专用位 · 不硬编答案 · 代理编排友好—70.3%87.9%1456——1M
Claude Sonnet 4.5 Anthropic1385——1455$3/M$15/M200K
Gemini 3.5 Flash-Lite 谷歌 👍 轻量成本优化档 · 部署友好Agent 自动化144076.9%84.1%1455$0.3/M$2.5/M1M
Grok 4.6 xAI 👍 X 原生集成 · 实时数据 · 2M 上下文编程数学 / 数据分析161775.3%92.9%1454$2/M$6/M500K
Hy3 腾讯1508——1454免费免费256K
Gemma 4 31B 谷歌1365——1452免费免费256K
GPT-5.6 Luna OpenAI 👍 便宜又能打 · 回复简洁 · 轻量任务甜点位—70.0%87.9%1452$0.2/M$1.2/M1.05M
MiMo-V2.6-Flash 小米编程Agent 自动化163679.3%74.8%1451$0.14/M$0.28/M1M
Kimi K2.5 月之暗面 👍 曾是日常主力 · 开放权重生态成熟143671.4%83.5%1450$0.6/M$3/M256K
MiMo-V2-Pro 小米1433——1448——1M
GPT-5.4 mini OpenAI139763.8%83.5%1447$0.75/M$4.5/M400K
Step 5 Preview 阶跃星辰1564——1447$1/M$2.7/M1M
Gemini 2.5 Pro 谷歌122859.3%81.3%1445$1.25/M$10/M1M
GPT-6 Luna OpenAI158267.3%87.4%1443$0.1/M$0.5/M1.05M
Grok 4.7 xAI编程1638——1443$2/M$6/M500K
Qwen3.6 Plus 阿里通义 👍 视觉可用 · 价格友好1461——1443——1M
Grok 4.3 xAI1357——1442$1.25/M$2.5/M1M
GLM-4.7 智谱 AI 👍 开源权重可自托管 · 安全研究引用常客143572.1%81.6%1441免费免费200K
MiniMax M3 MiniMax数学 / 数据分析148274.1%90.4%1440$0.3/M$1.2/M最高 1M
Gemma 4 26B A4B 谷歌1359——1438免费免费256K
Qwen3.8-27B 阿里通义 👍 单卡可跑 · 编码调试可用 · 2 天下载破百万编程Agent 自动化159277.0%82.3%1438免费免费262K
GPT-5.2 OpenAI141673.3%87.9%1437$1.75/M$14/M400K
DeepSeek V4 Flash 0731 深度求索 👍 第三方托管极便宜 · 缓存命中率 95%+ · 日常主力口碑158174.4%86.3%1436$0.14/M$0.28/M1M
MiMo-V2.5 小米143871.0%76.1%1434——1M
Qwen3 Max 阿里通义———1434——1M
Gemini 3.1 Flash-Lite 谷歌125672.0%81.6%1433$0.25/M$1.5/M1M
GLM-5V-Turbo 智谱 AI1401——1433$1.2/M$4/M200K
o3 OpenAI———1432$2/M$8/M200K
MiMo-V2-Omni 小米———1431——262K
Grok 4.1 Fast xAI1242——1430$0.2/M$0.5/M1M
Mistral Large 4 Mistral AI1534——1429$0.68/M$2.09/M1M
DeepSeek V3.2 深度求索 👍 Bedrock 官方托管 · 685B 开源权重 · 企业生态成熟136274.0%80.6%1425$0.28/M$0.42/M128K
GLM-4.6 智谱 AI134072.1%75.5%1424——200K
DeepSeek-R1 深度求索 👍 推理老牌标杆 · 开源可自部署—51.2%77.4%1421$0.55/M$2.19/M128K
Kimi K2 月之暗面 👍 文风成熟稳重 · 回复不啰嗦—59.1%74.5%1418$0.6/M$2.5/M128K
DeepSeek V3.1 深度求索 👍 本地部署生态好 · 学术研究常客 · GGUF 支持完善———1417免费免费128K
Qwen3.5-122B-A10B 阿里通义Agent 自动化136076.1%83.3%1416免费免费262K
GPT-4.1 OpenAI—47.8%64.6%1415$2/M$8/M1M
MiniMax M2.7 MiniMax139869.8%84.1%1415$0.3/M$1.2/M200K
Claude Haiku 4.5 Anthropic 👍 便宜快速 · 性价比标尺 · 结构化输出全支持1330——1414$1/M$5/M200K
Mistral Large 3 Mistral AI1230——1414$0.5/M$1.5/M128K
GLM-4.5 智谱 AI———1411$0.6/M$2.2/M128K
Grok 4 xAI———1411——128K
Gemini 2.5 Flash 谷歌—57.1%72.6%1409$0.3/M$2.5/M1M
Qwen3.5-27B 阿里通义1358——1409免费免费262K
o1 OpenAI———1402$15/M$60/M200K
GPT-5.4 nano OpenAI—65.3%77.7%1401$0.2/M$1.25/M400K
Qwen3.5 Flash 阿里通义1244——1396$0.1/M$0.4/M1M
DeepSeek V3 深度求索 👍 开源里程碑 · 评测对照常客———1395$0.27/M$1.1/M128K
Qwen3.5-35B-A3B 阿里通义125465.0%79.8%1394免费免费262K
Step 3.5 Flash 阶跃星辰———1393$0.1/M$0.3/M256K
MiniMax M2.5 MiniMax138765.7%82.9%1391$0.3/M$1.2/M128K
GPT-5 mini OpenAI—70.0%80.8%1390$0.25/M$2/M128K
MiMo-V2-Flash 小米1293——1386免费免费256K
GPT-4.1 mini OpenAI—43.8%64.9%1383$0.4/M$1.6/M1M
Claude 3.5 Sonnet Anthropic———1374$3/M$15/M200K
GLM-4.5-Air 智谱 AI—70.0%63.2%1373$0.2/M$1.1/M128K
GLM-4.7-Flash 智谱 AI—68.0%53.6%1365免费免费200K
Grok 3 Mini xAI———1364$0.3/M$0.5/M128K
o3-mini OpenAI———1364$1.1/M$4.4/M200K
GPT-OSS 120B OpenAI—63.4%72.6%1352免费免费128K
GPT-4o OpenAI—43.8%52.0%1346$2.5/M$10/M128K
Mercury 2 Inception1171——1344$0.25/M$0.75/M128K
Granite 4.2 30B IBM———1340免费免费128K
GPT-5 nano OpenAI—46.6%70.5%1337$0.05/M$0.4/M400K
GPT-4 Turbo OpenAI———1324$10/M$30/M128K
Claude 3 Opus Anthropic———1322$15/M$75/M200K
GPT-4.1 nano OpenAI—10.9%50.0%1322$0.1/M$0.4/M1M
GPT-4o mini OpenAI—28.4%43.2%1318$0.15/M$0.6/M128K
GPT-OSS 20B OpenAI—53.4%64.0%1317免费免费128K
Granite 4.2 3B IBM———1290免费免费128K
Granite 4.2 8B IBM—58.3%65.7%1290免费免费128K
Qwen2.5 Coder 32B Instruct 阿里通义———1271免费免费128K
Claude 3 Haiku Anthropic———1262$0.25/M$1.25/M200K
Phi-4 微软———1256免费免费16K
Mixtral 8x22B Instruct v0.1 Mistral AI———1230免费免费64K
Qwen3.8 Max 阿里通义 👍 托管多模态最佳 · 约束推理强 · SWE-bench 80.4%编程1672—————1M
Claude 4 Sonnet Anthropic—68.0%76.7%—$3/M$15/M200K
GPT-5.1-Codex OpenAI1337———$1.25/M$10/M400K
GPT-5.2-Codex OpenAI 👍 大型迁移能手 · 总成本极低 · 不盲目附和1339———$1.75/M$14/M400K
GPT-5.3 Codex OpenAI 👍 视觉+编码顺手 · 曾是编码巅峰 · 响应速度快Agent 自动化—75.3%——$1.75/M$14/M400K
Grok Code Fast 1 xAI1168———$0.2/M$1.5/M256K
Hy-MT2-30B-A3B 腾讯——38.9%—免费免费8K
Hy4 preview 腾讯 👍 递归自改进噱头足 · QAT 量化激进 · 已上 OpenCode Go—70.7%89.1%—免费免费1M
Kimi K2.7 Code 月之暗面 👍 Copilot 官方集成 · 编码专精 · 推理链更短147372.6%80.0%—$0.95/M$4/M256K
Ling 3.0 Flash 蚂蚁集团 InclusionAI—68.7%74.9%———262K
Ling 3.0 Flash Fin 蚂蚁集团 InclusionAI—70.8%50.5%———262K
Ling 3.0 Flash VL 蚂蚁集团 InclusionAI—70.0%84.9%—免费免费262K
Muse Glimmer 30B Meta—74.7%80.6%—免费免费131K
Qwen3.6-27B 阿里通义 👍 单卡可跑 · ≈Haiku 4.5 水平 · 本地性价比高—74.3%81.0%—免费免费262K
Qwen3.6-35B-A3B 阿里通义—71.1%79.5%———262K
Qwen3.8-Flash-Next 阿里通义 👍 自托管稳定可控 · 本地社区热度高 · 摆脱订阅省钱编程1632———免费免费262K
Seed 2.1 Pro 字节跳动1519—————256K
Step 3.7 Flash 阶跃星辰Agent 自动化—77.3%76.6%—$0.2/M$1.15/M256K

评分来自第三方公开评测,非厂商官方数据,仅作横向参考: Arena(LMArena)盲测 Elo,CC BY 4.0;OpenRouter 实测准确率。 Arena Elo 取同一模型最高推理档位的那次记录,票数与名次见鼠标悬停。榜单快照 2026-10-10。 纯开源权重、无第三方评测的模型不在本页,在 模型库。