本文转载自微信公众号「阿若Arrows」,点此查看原文。
看到DeepSeek V4.1 Flash发布,我起初没太想做测试,认为无非就是一次小版本迭代。
但这两天,铺天盖地都是它跟GPT-Astra、Fable 5.1、K3对比的视频和帖子,看得我满脑子问号:你让DeepSeek 跟啥比?DeepSeek喝大了?
甚至还有帖子说,V4.1 Flash能力直逼Astra,成本低得可怕。
行,那我必须看看它的深浅了。
我也不苛求它,去跟GPT-5.6 Sol打一场。
到底是无脑吹还是有真东西,一试便知。
不比跑分,比实测结果
这种模型测评最容易注水的地方,就是只比纸面数据,但往往忽略了实际使用体验。
所以我不比跑分,只对比真上手做同一件事,要花多少时间、多少token、返几次工、每秒吐多少字、产物可用性等等。
三个场景,同样的prompt和输入文件,两个模型各跑一遍,让我们来看效果究竟怎么样。
注意:本次对比中,deepseek V4.1 Flash全程基于谷价进行,日常使用峰价的同学请把成本乘2;GPT 5.6 Sol则是根据token数和官方api定价估算得到大致花费。
两个模型分别在专属的deepseek harness和codex下进行使用,默认都开启high的思考程度。
场景一:HelloKitty 版我的世界


第一个场景,我挑了HelloKitty版我的世界。
模型需要先识别图片里的HelloKitty元素,包括形象、配色、氛围;再把它们翻译成一套跑得起来的游戏逻辑,移动、放置、破坏方块,每一步都是真实交互。

先上场的是GPT-5.6 Sol。
它花了17分52秒完成任务,来看实际效果:场景完成度很高,风格统一,是扑面而来的猛男粉。
跳跃、交互、破坏方块都做得相当完善,空中还有飘落的粒子特效。
作为场景来说,几乎是一次通过。
这一轮它总计使用8.6M token,按官方API定价估算,花费大约$5.46。
📹
轮到DeepSeek V4.1 Flash上场。它用了19分55秒完成第一版任务,共使用39.3Mtoken,按谷价折算约¥2.3。

进入页设计了相当多功能,包括动物运动系统以及更多、更复杂的交互逻辑。

实际体验却没有第一印象那么顺利,真正进入之后,画面就出了问题。
📹
随后又经过几轮修复,最终效果如下:
📹
整体风格保持一致,但地面缺失、动物行走逻辑这两个问题,反复修改了几轮依然没能解决,我也就到此为止不再继续折腾了。
场景二:图生 3D
请参考这张建筑图,把它生成一个 3D 效果。只做塔的外部视角即可,请直接输出能查看或转视角的 3D 结果。
3D生成依旧是目前的难点,跟平面完全不是一个难度级别。
2D生成这几年被各家卷得很熟,而且风格、光影各有特点,想糊弄总能糊弄过去。3D可不一样,读懂一张平面建筑图,把里面的空间关系重建出来,最后还得输出一个可交互的3D结果。
几何关系作为硬性硬约束,其中的透视对不对、结构是否合理,转个视角一眼就能看出来,做不了假。
这一轮GPT花费了11分50秒得出结果,约3.2M token,$2.84
📹
虽然精细度方面还有待加强,但是从楼本身来看,九层的结构,檐角、塔顶等都有覆盖,没有明显的穿模现象,任务本身还是基本完成了。
然后是ds 4.1,这次单轮对话就花费了32分钟,将近20 M 的 token,来看看结果如何。
📹
Deepseek也完成了要求,基于草图完成了三维外观的设计。
同时也存在一些问题,比如层与层之间缺少了连接,出现了悬空的情况;
但在细节层面,从塔身的纹理、影子的形状,以及各个装饰在塔面的投影,相较于5.6甚至更胜一筹。
场景三:HTML 动画 · 鹈鹕骑车
接下来是最近爆火的鹈鹕骑车测试。
这个梗会火,一靠画面本身的魔性,大嘴鹈鹕蹬着自行车,动作本身就很有喜感;二是各家模型跑同一个题差距极大,水平高下立刻见分晓。
题目看着只有一句话,但对于综合能力的考量极高。
自行车的脚蹬、车身;鹈鹕的翅膀、腿,每个部件都要动起来。
鹈鹕和车之间还得配合得上,比如翅膀和车把的交互、腿和脚蹬的交互。
还有骑行过程的循环要顺畅、物体之间的比例要合理、背景和路面的画面在移动过程中不能穿帮等等,综合构成了一道复杂的考题。
创建一个 HTML,内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画。不到三分钟,5.6Sol给出了结果。📹
很明显存在一些问题,比如自行车的脚蹬空转,鸟的眼睛莫名其妙会掉下来,背景线条乱动,使用0.5M token。
接下来是Ds 4.1,用时4分25秒,1.3M token。
📹
问题依旧很多,比如脚在乱飞、马路上的白线和草运动不连贯、身体悬空没有连接到座椅上等等,看完这两的表现我真的绷不住了。
鉴于上面两位选手的成绩都不算特别理想,我引入了终极Boss–GPT 6 Astra,用时5分17秒,只用了0.4M token,约$1.8。
📹
可见贵还是有贵的道理,主体、运动状态、背景都相当规范,交互也是合理的,甚至加入了自动调节速度和暂停的选项。
总结
测试完,我先给出最直接答案
现在的DeepSeek还不足以碰瓷Astra,甚至5.6sol都悬

总结三个案例的结果不难发现,Ds 4.1的优势集中在快和成本两个维度。
单次输出成本几乎是5.6 Sol的五分之一到十分之一,都这么便宜了还要什么自行车。
每秒输出token数几乎稳定在了300 tok/s的水平,但是由于相同任务需要的token数更多,整体任务耗时在本次实测下来没有拉开特别明显的差距;

产物质量和5.6 Sol相比各有优劣,整体上会稍微逊色一点;而和Astra的距离则相对会更远一些。
另外则是Ds 4.1自带了原生多模态,相较于上代,这确实是极大的解决了日常使用中的痛点。
如果你的日常工作和使用兼顾以上需求,那Deepseek V4.1 Flash会是一个不错的选择。