2026-10-08最新大模型实测性价比排行榜

「实测性价比」= 实测准确率 ÷ 实测单任务成本。分子是该次运行的实际准确率,分母是跑完同一次任务的实际花费,两者取自同一条运行记录。按准确率门槛切成两档:够用档是准确率过线的全部模型,机会档是门槛以下按比值排序的前列。两档分开,是因为这个比值在准确率很低时仍然可以很大。

榜单汇总点评:这份榜单最抢眼的不是某家包场,而是 Ling 3.0 Flash VL:在知识推理够用档和 Agent 够用档都拿下第一;Ling 3.0 Flash 又分别排进知识推理前三、Agent 机会档榜首,性价比存在感拉满。反差在于机会档知识推理由 Llama 3 8B Lunaris 领跑,指标远高于第二名 Mistral Nemo;但这档准确率低于 70%,不能和够用档直接比。熟悉的大厂也没缺席:Google 的 Gemma 4 进入知识推理前列,OpenAI 的 GPT-6 Luna 两档都有排名,不过榜单主角显然是 Ling。

知识推理性价比(GPQA Diamond)

够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 674.3;第二名 GPT-6 Luna 295.9。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。

实测性价比=实测准确率 ÷ 实测单任务成本。分母是跑一次任务的实际花费,分子是同一次运行的实际准确率。够用档要求准确率 ≥70%。GPQA Diamond 是研究生难度的科学问答。

#1 Ling 3.0 Flash VL 厂商:蚂蚁集团 InclusionAI 实测准确率:84.8% 每任务成本:$0.001261.Ling 3.0 Flash VL674.3#2 GPT-6 Luna 厂商:OpenAI 实测准确率:87.4% 每任务成本:$0.002952.GPT-6 Luna295.9#3 Ling 3.0 Flash 厂商:蚂蚁集团 InclusionAI 实测准确率:74.9% 每任务成本:$0.002613.Ling 3.0 Flash287.2#4 Qwen3.5 9B (Non-reasoning) 厂商:阿里通义 实测准确率:77.3% 每任务成本:$0.005934.Qwen3.5 9B…130.4#5 Qwen3 235B A22B 2507 Instruct (Reasoning) 厂商:阿里通义 实测准确率:72.8% 每任务成本:$0.005765.Qwen3 235B A22B 2507…126.4#6 Gemma 4 31B (Reasoning) 厂商:谷歌 实测准确率:81.8% 每任务成本:$0.006486.Gemma 4 31B…126.3#7 GPT-5.6 Luna 厂商:OpenAI 实测准确率:87.9% 每任务成本:$0.007917.GPT-5.6 Luna111.1#8 DeepSeek V4 Flash 0731 厂商:深度求索 实测准确率:86.3% 每任务成本:$0.007988.DeepSeek V4 Flash…108.1#9 GPT-6 Luna Pro 厂商:OpenAI 实测准确率:88.4% 每任务成本:$0.008309.GPT-6 Luna Pro106.5#10 DeepSeek V3.2 厂商:深度求索 实测准确率:80.6% 每任务成本:$0.0077010.DeepSeek V3.2104.6#11 DeepSeek V3.2 Exp (Reasoning) 厂商:深度求索 实测准确率:82.2% 每任务成本:$0.0080311.DeepSeek V3.2 Exp…102.3#12 GPT-OSS 120B 厂商:OpenAI 实测准确率:72.6% 每任务成本:$0.0080412.GPT-OSS 120B90.3#13 GLM-5.3-Flash 厂商:智谱 AI 实测准确率:90.9% 每任务成本:$0.0122913.GLM-5.3-Flash74.0#14 MiMo-V2.5 厂商:小米 实测准确率:76.1% 每任务成本:$0.0116914.MiMo-V2.565.1#15 Qwen3 Next 80B A3B Instruct 厂商:阿里通义 实测准确率:70.9% 每任务成本:$0.0111315.Qwen3 Next 80B A3B…63.7#16 GPT-5.4 nano 厂商:OpenAI 实测准确率:77.7% 每任务成本:$0.0130816.GPT-5.4 nano59.4#17 Jev Router 厂商:typesafe 实测准确率:93.9% 每任务成本:$0.0159317.Jev Router59.0#18 Switchyard 厂商:英伟达 实测准确率:90.7% 每任务成本:$0.0158318.Switchyard57.3#19 GPT-5 nano 厂商:OpenAI 实测准确率:70.5% 每任务成本:$0.0133719.GPT-5 nano52.7#20 Mistral Small 4 (Reasoning) 厂商:Mistral AI 实测准确率:75.8% 每任务成本:$0.0145620.Mistral Small 4…52.0

够用档 (准确率 70% 以上)

够好且最便宜 —— 绝大多数场景直接看这一段 · 共 111 个模型(国产 49)

够用档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash VL蚂蚁集团 InclusionAI84.8%$0.00126674.3
2GPT-6 LunaOpenAI87.4%$0.00295295.9
3Ling 3.0 Flash蚂蚁集团 InclusionAI74.9%$0.00261287.2
4Qwen3.5 9B (Non-reasoning)阿里通义77.3%$0.00593130.4
5Qwen3 235B A22B 2507 Instruct (Reasoning)阿里通义72.8%$0.00576126.4
6Gemma 4 31B (Reasoning)谷歌81.8%$0.00648126.3
7GPT-5.6 LunaOpenAI87.9%$0.00791111.1
8DeepSeek V4 Flash 0731深度求索86.3%$0.00798108.1
9GPT-6 Luna ProOpenAI88.4%$0.00830106.5
10DeepSeek V3.2深度求索80.6%$0.00770104.6
11DeepSeek V3.2 Exp (Reasoning)深度求索82.2%$0.00803102.3
12GPT-OSS 120BOpenAI72.6%$0.0080490.3
13GLM-5.3-Flash智谱 AI90.9%$0.0122974.0
14MiMo-V2.5小米76.1%$0.0116965.1
15Qwen3 Next 80B A3B Instruct阿里通义70.9%$0.0111363.7
16GPT-5.4 nanoOpenAI77.7%$0.0130859.4
17Jev Routertypesafe93.9%$0.0159359.0
18Switchyard英伟达90.7%$0.0158357.3
19GPT-5 nanoOpenAI70.5%$0.0133752.7
20Mistral Small 4 (Reasoning)Mistral AI75.8%$0.0145652.0
21Qwen3 Coder Next阿里通义74.6%$0.0147950.4
22DeepSeek V3.1 Terminus (Reasoning)深度求索77.6%$0.0157449.3
23DeepSeek V3.1 (Non-reasoning)深度求索74.4%$0.0159046.8
24Gemma 4 26B A4B (Reasoning)谷歌73.1%$0.0156346.7
25MiMo-V2.6-Flash小米74.7%$0.0166744.8
26GPT-6.1 SolOpenAI94.4%$0.0213744.2
27Kimi K2月之暗面74.5%$0.0175842.3
28Qwen3.8 Flash阿里通义88.6%$0.0214641.3
29DeepSeek V4 Flash Vision (Max)深度求索88.0%$0.0227938.6
30DeepSeek V4.1 Flash深度求索88.9%$0.0243936.5

机会档 (准确率 低于 70%)

只列出前 30 名;本档准确率低于 70% · 共 36 个模型(国产 18)

机会档前 30 名
#模型厂商准确率每任务成本性价比
1Llama 3 8B Lunarissao10k27.3%$0.000064357.7
2Mistral NemoMistral33.0%$0.000122832.8
3Hy-MT2-30B-A3B腾讯38.9%$0.000231680.0
4新Gemma 3 12B Instruct谷歌37.9%$0.000341099.6
5↓1Llama 3.2 Instruct 3BMeta11.6%$0.00015755.3
6↓1Qwen2.5 7B Instruct阿里通义32.8%$0.00053617.3
7↓1GPT-4.1 nanoOpenAI50.0%$0.00084597.9
8↓1Qwen2.5 Instruct 72B阿里通义46.0%$0.00103447.1
9↓1GPT-4o miniOpenAI43.2%$0.00101429.5
10↓1Llama 3.3 Instruct 70BMeta47.3%$0.00144328.7
11↓1Qwen2.5 VL 72B Instruct阿里通义44.4%$0.00152291.6
12↓1Qwen3 30B A3B 2507 Instruct阿里通义64.4%$0.00260247.4
13↓1Llama 4 MaverickMeta66.0%$0.00274240.5
14↓1Qwen3 14B (Reasoning)阿里通义59.2%$0.00292202.6
15↓1Llama 3.1 Instruct 8BMeta28.6%$0.00141202.2
16↓1Qwen3 Coder 480B A35B Instruct阿里通义60.4%$0.00349173.2
17↓1DeepSeek V3 0324深度求索62.1%$0.00383162.1
18↓1GPT-4.1 miniOpenAI64.9%$0.00408159.3
19↓1Qwen3 Coder 30B A3B Instruct阿里通义52.0%$0.00357145.6
20↓1Qwen3 VL 30B A3B Instruct阿里通义64.8%$0.0070092.6
21↓1Qwen3 VL 235B A22B Instruct阿里通义69.5%$0.0088478.6
22↓1Qwen3 30B A3B (Reasoning)阿里通义62.1%$0.0082775.1
23↓1Qwen3 VL 8B Instruct阿里通义51.3%$0.0068874.6
24↓1Qwen3 32B (Reasoning)阿里通义60.9%$0.0084272.4
25↓1Nemotron 3.5 Lightning英伟达69.3%$0.0099070.0
26↓1GPT-OSS 20BOpenAI64.0%$0.0107659.5
27↓1Ling 3.0 Flash Fin蚂蚁集团 InclusionAI50.5%$0.0097651.8
28↓1Granite 4.2 8BIBM65.7%$0.0148644.2
29↓1GPT-4.1OpenAI64.6%$0.0153742.1
30↓1NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)英伟达62.9%$0.0171936.6

Agent 能力性价比(τ-bench 航空客服)

够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 233.0;第二名 Ling 3.0 Flash Fin 146.1。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。

同一个算法,用在 τ-bench 航空客服:多轮工具调用、查政策、处理改签与退票。

#1 Ling 3.0 Flash VL 厂商:蚂蚁集团 InclusionAI 实测准确率:70.0% 每任务成本:$0.003001.Ling 3.0 Flash VL233.0#2 Ling 3.0 Flash Fin 厂商:蚂蚁集团 InclusionAI 实测准确率:70.7% 每任务成本:$0.004842.Ling 3.0 Flash Fin146.1#3 GLM-5.3-Flash 厂商:智谱 AI 实测准确率:75.6% 每任务成本:$0.006673.GLM-5.3-Flash113.3#4 MiMo-V2.5 厂商:小米 实测准确率:71.0% 每任务成本:$0.008484.MiMo-V2.583.7#5 DeepSeek V4 Flash 0731 厂商:深度求索 实测准确率:74.4% 每任务成本:$0.011065.DeepSeek V4 Flash…67.3#6 GPT-5.6 Luna 厂商:OpenAI 实测准确率:70.0% 每任务成本:$0.010926.GPT-5.6 Luna64.1#7 Qwen3.8 Flash 厂商:阿里通义 实测准确率:71.3% 每任务成本:$0.016657.Qwen3.8 Flash42.8#8 GLM-4.5-Air 厂商:智谱 AI 实测准确率:70.0% 每任务成本:$0.017558.GLM-4.5-Air39.9#9 MiMo-V2.6-Flash 厂商:小米 实测准确率:79.3% 每任务成本:$0.020429.MiMo-V2.6-Flash38.8#10 Step 3.7 Flash 厂商:阶跃星辰 实测准确率:77.3% 每任务成本:$0.0201210.Step 3.7 Flash38.4#11 MiniMax M3 厂商:MiniMax 实测准确率:74.1% 每任务成本:$0.0234911.MiniMax M331.5#12 Gemma 4 31B (Reasoning) 厂商:谷歌 实测准确率:76.7% 每任务成本:$0.0282212.Gemma 4 31B…27.2#13 DeepSeek V3.2 厂商:深度求索 实测准确率:74.0% 每任务成本:$0.0298613.DeepSeek V3.224.8#14 DeepSeek V4 Flash Vision (Max) 厂商:深度求索 实测准确率:74.8% 每任务成本:$0.0301714.DeepSeek V4 Flash…24.8#15 MiMo-V2.5-Pro 厂商:小米 实测准确率:73.6% 每任务成本:$0.0303715.MiMo-V2.5-Pro24.2#16 DeepSeek V4.1 Flash 厂商:深度求索 实测准确率:76.2% 每任务成本:$0.0315416.DeepSeek V4.1 Flash24.2#17 GLM-5.2 厂商:智谱 AI 实测准确率:72.7% 每任务成本:$0.0340017.GLM-5.221.4#18 Muse Glimmer 30B 厂商:Meta 实测准确率:74.7% 每任务成本:$0.0374318.Muse Glimmer 30B19.9#19 Kimi K2.5 厂商:月之暗面 实测准确率:71.4% 每任务成本:$0.0400119.Kimi K2.517.9#20 GLM-5 厂商:智谱 AI 实测准确率:77.0% 每任务成本:$0.0446720.GLM-517.2

够用档 (准确率 70% 以上)

够好且最便宜 —— 绝大多数场景直接看这一段 · 共 76 个模型(国产 38)

够用档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash VL蚂蚁集团 InclusionAI70.0%$0.00300233.0
2Ling 3.0 Flash Fin蚂蚁集团 InclusionAI70.7%$0.00484146.1
3GLM-5.3-Flash智谱 AI75.6%$0.00667113.3
4MiMo-V2.5小米71.0%$0.0084883.7
5DeepSeek V4 Flash 0731深度求索74.4%$0.0110667.3
6GPT-5.6 LunaOpenAI70.0%$0.0109264.1
7Qwen3.8 Flash阿里通义71.3%$0.0166542.8
8GLM-4.5-Air智谱 AI70.0%$0.0175539.9
9MiMo-V2.6-Flash小米79.3%$0.0204238.8
10Step 3.7 Flash阶跃星辰77.3%$0.0201238.4
11MiniMax M3MiniMax74.1%$0.0234931.5
12Gemma 4 31B (Reasoning)谷歌76.7%$0.0282227.2
13DeepSeek V3.2深度求索74.0%$0.0298624.8
14DeepSeek V4 Flash Vision (Max)深度求索74.8%$0.0301724.8
15MiMo-V2.5-Pro小米73.6%$0.0303724.2
16DeepSeek V4.1 Flash深度求索76.2%$0.0315424.2
17GLM-5.2智谱 AI72.7%$0.0340021.4
18Muse Glimmer 30BMeta74.7%$0.0374319.9
19Kimi K2.5月之暗面71.4%$0.0400117.9
20GLM-5智谱 AI77.0%$0.0446717.2
21Qwen3.6-35B-A3B阿里通义71.1%$0.0481514.8
22GLM-4.6智谱 AI72.1%$0.0499414.4
23Kimi K2 (Thinking)月之暗面71.3%$0.0546113.1
24Qwen3.7 Plus阿里通义70.3%$0.0542513.0
25GLM-4.7智谱 AI72.1%$0.0580912.4
26GLM-5.3智谱 AI76.1%$0.0619512.3
27DeepSeek V3.1 Terminus (Reasoning)深度求索70.4%$0.0594911.8
28MiMo-V2.6-Pro小米71.7%$0.0670110.7
29Kimi K2.6月之暗面74.1%$0.0733110.1
30GPT-5.6 Luna ProOpenAI71.1%$0.071879.9

机会档 (准确率 低于 70%)

只列出前 30 名;本档准确率低于 70% · 共 59 个模型(国产 26)

机会档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash蚂蚁集团 InclusionAI68.7%$0.00220312.7
2GLM-4.7-Flash智谱 AI68.0%$0.0088976.5
3GPT-6 LunaOpenAI67.3%$0.0092972.5
4Llama 3.1 Instruct 8BMeta21.5%$0.0051441.8
5Granite 4.2 8BIBM58.3%$0.0153038.1
6Nemotron 3.5 Lightning英伟达65.6%$0.0173337.8
7Gemma 4 26B A4B (Reasoning)谷歌67.9%$0.0207732.7
8GPT-OSS 120BOpenAI63.4%$0.0197232.2
9Mistral Small 4 (Reasoning)Mistral AI43.7%$0.0143830.4
10MiniMax M2.5MiniMax65.7%$0.0225929.1
11Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)谷歌50.3%$0.0177028.4
12MiniMax M2.7MiniMax69.8%$0.0256727.2
13MiniMax-M2.1MiniMax64.3%$0.0249025.8
14Qwen3.5 9B (Non-reasoning)阿里通义69.3%$0.0311222.3
15GPT-OSS 20BOpenAI53.4%$0.0243421.9
16Qwen3 32B (Reasoning)阿里通义47.8%$0.0221121.6
17GPT-5.4 nanoOpenAI65.3%$0.0321020.4
18Gemini 2.5 Flash谷歌57.1%$0.0286619.9
19Qwen3 Next 80B A3B Instruct阿里通义47.0%$0.0247519.0
20NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)英伟达51.8%$0.0282718.3
21Qwen3 Coder 30B A3B Instruct阿里通义43.1%$0.0236018.3
22GPT-6 Luna ProOpenAI66.7%$0.0387617.2
23GPT-4.1 miniOpenAI43.8%$0.0259516.9
24Qwen3 235B A22B 2507 Instruct (Reasoning)阿里通义41.6%$0.0247016.9
25GPT-4.1 nanoOpenAI10.9%$0.0067816.1
26Qwen3 30B A3B 2507 Instruct阿里通义38.8%$0.0257115.1
27Qwen3 14B (Reasoning)阿里通义43.1%$0.0297714.5
28GPT-4o miniOpenAI28.4%$0.0208113.7
29Qwen3 Coder Next阿里通义55.0%$0.0410113.4
30Inkling Smallthinkingmachines60.7%$0.0465113.0

数据来源:OpenRouter (已由本站排序与聚合) · 许可 CC BY 4.0

数据更新于 2026-10-08 · 底表更新于 2026-10-08 00:00