网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

阿若Arrows阅读约 5 分钟

本文转载自微信公众号「阿若Arrows」,点此查看原文。

看到DeepSeek V4.1 Flash发布,我起初没太想做测试,认为无非就是一次小版本迭代。

但这两天,铺天盖地都是它跟GPT-Astra、Fable 5.1、K3对比的视频和帖子,看得我满脑子问号:你让DeepSeek 跟啥比?DeepSeek喝大了?

甚至还有帖子说,V4.1 Flash能力直逼Astra,成本低得可怕。

行,那我必须看看它的深浅了。

我也不苛求它,去跟GPT-5.6 Sol打一场。

到底是无脑吹还是有真东西,一试便知。

不比跑分,比实测结果

这种模型测评最容易注水的地方,就是只比纸面数据,但往往忽略了实际使用体验。

所以我不比跑分,只对比真上手做同一件事,要花多少时间、多少token、返几次工、每秒吐多少字、产物可用性等等。

三个场景,同样的prompt和输入文件,两个模型各跑一遍,让我们来看效果究竟怎么样。

注意:本次对比中,deepseek V4.1 Flash全程基于谷价进行,日常使用峰价的同学请把成本乘2;GPT 5.6 Sol则是根据token数和官方api定价估算得到大致花费。

两个模型分别在专属的deepseek harness和codex下进行使用,默认都开启high的思考程度。

场景一:HelloKitty 版我的世界

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

第一个场景,我挑了HelloKitty版我的世界。

模型需要先识别图片里的HelloKitty元素,包括形象、配色、氛围;再把它们翻译成一套跑得起来的游戏逻辑,移动、放置、破坏方块,每一步都是真实交互。

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

先上场的是GPT-5.6 Sol。

它花了17分52秒完成任务,来看实际效果:场景完成度很高,风格统一,是扑面而来的猛男粉。

跳跃、交互、破坏方块都做得相当完善,空中还有飘落的粒子特效。

作为场景来说,几乎是一次通过。

这一轮它总计使用8.6M token,按官方API定价估算,花费大约$5.46。

📹

轮到DeepSeek V4.1 Flash上场。它用了19分55秒完成第一版任务,共使用39.3Mtoken,按谷价折算约¥2.3。

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

进入页设计了相当多功能,包括动物运动系统以及更多、更复杂的交互逻辑。

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

实际体验却没有第一印象那么顺利,真正进入之后,画面就出了问题。

📹

随后又经过几轮修复,最终效果如下:

📹

整体风格保持一致,但地面缺失、动物行走逻辑这两个问题,反复修改了几轮依然没能解决,我也就到此为止不再继续折腾了。

场景二:图生 3D

text
请参考这张建筑图,把它生成一个 3D 效果。只做塔的外部视角即可,请直接输出能查看或转视角的 3D 结果。

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

3D生成依旧是目前的难点,跟平面完全不是一个难度级别。

2D生成这几年被各家卷得很熟,而且风格、光影各有特点,想糊弄总能糊弄过去。3D可不一样,读懂一张平面建筑图,把里面的空间关系重建出来,最后还得输出一个可交互的3D结果。

几何关系作为硬性硬约束,其中的透视对不对、结构是否合理,转个视角一眼就能看出来,做不了假。

这一轮GPT花费了11分50秒得出结果,约3.2M token,$2.84

📹

虽然精细度方面还有待加强,但是从楼本身来看,九层的结构,檐角、塔顶等都有覆盖,没有明显的穿模现象,任务本身还是基本完成了。

然后是ds 4.1,这次单轮对话就花费了32分钟,将近20 M 的 token,来看看结果如何。

📹

Deepseek也完成了要求,基于草图完成了三维外观的设计。

同时也存在一些问题,比如层与层之间缺少了连接,出现了悬空的情况;

但在细节层面,从塔身的纹理、影子的形状,以及各个装饰在塔面的投影,相较于5.6甚至更胜一筹。

场景三:HTML 动画 · 鹈鹕骑车

接下来是最近爆火的鹈鹕骑车测试。

这个梗会火,一靠画面本身的魔性,大嘴鹈鹕蹬着自行车,动作本身就很有喜感;二是各家模型跑同一个题差距极大,水平高下立刻见分晓。

题目看着只有一句话,但对于综合能力的考量极高。

自行车的脚蹬、车身;鹈鹕的翅膀、腿,每个部件都要动起来。

鹈鹕和车之间还得配合得上,比如翅膀和车把的交互、腿和脚蹬的交互。

还有骑行过程的循环要顺畅、物体之间的比例要合理、背景和路面的画面在移动过程中不能穿帮等等,综合构成了一道复杂的考题。

text
创建一个 HTML,内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画。不到三分钟,5.6Sol给出了结果。

📹

很明显存在一些问题,比如自行车的脚蹬空转,鸟的眼睛莫名其妙会掉下来,背景线条乱动,使用0.5M token。

接下来是Ds 4.1,用时4分25秒,1.3M token。

📹

问题依旧很多,比如脚在乱飞、马路上的白线和草运动不连贯、身体悬空没有连接到座椅上等等,看完这两的表现我真的绷不住了。

鉴于上面两位选手的成绩都不算特别理想,我引入了终极Boss–GPT 6 Astra,用时5分17秒,只用了0.4M token,约$1.8。

📹

可见贵还是有贵的道理,主体、运动状态、背景都相当规范,交互也是合理的,甚至加入了自动调节速度和暂停的选项。

总结

测试完,我先给出最直接答案

现在的DeepSeek还不足以碰瓷Astra,甚至5.6sol都悬

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

总结三个案例的结果不难发现,Ds 4.1的优势集中在快和成本两个维度。

单次输出成本几乎是5.6 Sol的五分之一到十分之一,都这么便宜了还要什么自行车。

每秒输出token数几乎稳定在了300 tok/s的水平,但是由于相同任务需要的token数更多,整体任务耗时在本次实测下来没有拉开特别明显的差距;

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

产物质量和5.6 Sol相比各有优劣,整体上会稍微逊色一点;而和Astra的距离则相对会更远一些。

另外则是Ds 4.1自带了原生多模态,相较于上代,这确实是极大的解决了日常使用中的痛点。

如果你的日常工作和使用兼顾以上需求,那Deepseek V4.1 Flash会是一个不错的选择。