ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Z Finance阅读约 13 分钟

本文转载自微信公众号「Z Finance」,点此查看原文。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

导语

9月10日,DeepSeek V4.1 Flash正式开源。这个552B的新模型引入了新的**CED(Causal Encoder-Decoder)**架构:prefill阶段每个token只激活8B参数,decode阶段激活16B,KV Cache大幅缩小,Agent任务下的部署成本被明显压低。

前两日,它已先行开启中间版本内测,原生多模态、推理速度和成本是当时的关键词,视觉与空间感知的提升也让外界对它的任务理解能力有了更多期待。沿着ZPedia一贯的测评思路,我们更关心这些能力落到真实任务里还剩多少:多模态理解与执行效率能不能同时兑现,模型能不能自己把活干完,交付物的数据、交互和画面是否经得起检查。

为此我们准备了五道题,从还原一张网页截图,到数据看板、规则模拟、3D交互和15秒视频生成,覆盖的都是模型容易“看起来完成”的场景。

组织层面的信号也指向同一个方向:DeepSeek同期放出约150个工程岗位,全部投向服务端与Agent弹性计算,没有一个研究岗;Harness也更新到v0.1.5,和V4.1 Flash一起训练迭代。模型和Harness同时加码,竞争的重心正在向交付链路转移。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

聚焦原生多模态:推理速度更快,空间感知超预期

DeepSeek早在8月就给Flash加入了看图能力。

8月21日上线的V4-Flash-Vision-Exp,支持通过API输入图片。按官方当时的介绍,这个版本保留了Flash的文本能力,同时加强了Agent视觉任务。这次V4.1 Flash则采用了原生多模态的支持,并进一步增强了视觉感知和空间感知能力。

官方这张图给了四项Agent分数。V4.1 Flash全面领先Kimi-K3:Terminal-Bench 3.0为30.0比17.7,DeepSWE v1.1为74.2比67.5,CyberGym为88.1比80.0,Automation-Bench为54.8比46.7;但相比闭源模型仍有缺口。多模态表现上,V4.1 Flash视觉推理和专业图表解读超过Kimi-K3,前端开发、办公自动化这类看截图做自检的流程也能成功闭环。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

下面两张图示的任务,是要求模型把视频重建成能走进去的房间。对比Astra的效果,DeepSeek V4.1 Flash在重建的细节上会有缺失,空间和排布上不够准确;同时视频截图不全就开工,导致信息丢失;迭代时只专注于搞渲染,各种穿模问题还是遗留问题,在自检上有待改进,不过也算大幅度超出预期。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

DeepSeek V4.1 Flash空间感知效果,图源:测试用户Subly7

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Astra空间感知效果,图源:测试用户Subly7

接下来,很多模型公司会把重点放在3D任务上。不单是Blender,网页三维、工业CAD、镜头动画、多张照片及视频重建,以及渲染自检,都会变成比拼项。看懂空间不够,还得在常用的三维软件里把东西做出来。

速度方面,社区有人报出了约350 tokens/s的平均解码速度。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

NVIDIA开发者论坛转帖:平均解码速度约为350 tokens/s

DeepSeek-V4.1-Flash的推理速度提升,来自prefill、长上下文decode、投机解码和底层执行几个环节的开销压缩。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

首先,它引入**Causal Encoder-Decoder(CED)**架构,将40层网络拆成20层因果编码器和20层解码器:在处理长prompt时,绝大多数输入token只需完整经过前半部分encoder,decoder所需的global KV则直接由encoder最后一层的hidden states通过逐层投影生成,而不是让所有prompt token再跑一遍后半模型。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

再配合Decoder SWA Bounded Replay,将长序列prefill的复杂度从O(NL)降到近似O(NL/2),也就是接近砍掉一半输入侧计算。

在生成阶段,DeepSeek又用**Compressed Sparse Attention 2(CSA2)**降低长上下文带来的KV和索引成本:CSA2把注意力层分成Full、Reindex和Reuse三种模式,只有Full层完整生成global KV并执行Top-K检索,Reindex层复用前层的main KV和indexer K、只重新打分选择新的Top-K,而Reuse层连索引计算都省掉,直接复用之前的KV和Top-K结果。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

与此同时,Hierarchical Sparse Indexer让第一层indexer从完整上下文中先筛出一个较大的candidate pool,后续层只在这个固定候选集合内重新选择Top-K,因此后续indexing的成本不再随上下文长度线性增长,这也是其在百万token上仍能控制单token decode开销的关键。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

为进一步提高实际出词速度,模型还加入DSpark speculative decoding:一个仅含3个Transformer block的轻量drafter会在一次forward中并行预测5个候选位置,再由confidence head估计这些候选被主模型接受的概率,并结合当前推理引擎的吞吐曲线动态选择verification length,目标是让每次昂贵的主模型验证尽可能推进更多有效token,从而提升整体tokens/s。

换句话说,DeepSeek-V4.1-Flash的“快”本质上是同时做到最关键的三项加速:CED把长输入的prefill计算近乎减半,CSA2让百万token上下文下的decode成本不随长度失控,以及DSpark通过多token投机解码直接提高生成吞吐。

此外,DeepSeek还把Single-Pass mHC与Mega-mHC kernel结合,通过将input-mixing coefficient错后一层使用来打破原有的数据依赖,使residual update、input mixing、coefficient prediction、pre-norm等操作能够高度融合,最终把activation memory traffic大致减半;同时将main KV cache压到FP4,降低HBM、SSD和互连上的数据搬运量,并通过fused attention、Mega-MoE、TopK等kernel fusion将大多数CSA2 Reuse层压缩到prefill约15个kernel、decode约11个kernel。这些改动更像是把前面这些架构收益真正兑现到GPU上,通过少搬内存、少占HBM、少启动kernel进一步把latency和throughput做上去。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

招 150 个工程岗,把模型装进 Harness

9月8日新模型内测开放的同一天,DeepSeek放出约150个工程师岗位。只有两类:服务端开发,以及Agent弹性计算。重点面向2到10年经验的资深后端,值得一提的是,招聘信息里没有AI研究岗。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

这已经不是DeepSeek今年第一次招人。6月的招聘方案是把所有部门至少扩大一倍,研究岗还在名单上;这一次150个名额全部划分给工程,投向也很集中:服务端覆盖研究平台、Agent框架、效率基建、API、线上服务和数据工程,弹性计算对应V4技术报告里的DSec(DeepSeek Elastic Compute),系统栈要从操作系统一直改到应用层调度。

团队负责人崔添翼把原因写得很直白:数据量、训练任务、Agent环境和用户请求一起涨上来,很多新方向、新系统、新需求都要落地,原有后端得跟着升级、维护,部分模块甚至要重写。

把这条线和模型能力放在一起,指向是清楚的:**模型侧在推多模态和效率,组织侧聚焦请求的稳定支持、环境的正常调度。**最直接的信号来自研究岗的数量:如果瓶颈还是“再发一个更强的研究模型”,这轮不会一个研究岗都不设。

扩招工程师进一步说明了DeepSeek的意图,后AI时代,决定模型和服务上限的是组织和管理模式:怎么组织好一个Lab,让动作不变形,从而提升GPU Efficiency。

9月10日,DeepSeek Harness更新到v0.1.5,而这一版与V4.1 Flash是绑在一起做的:模型在Harness的标准模式、程序化工具调用和极简模式下都做过专项训练和优化,修改系统提示词时还能保留已有的KV Cache。再往细看,父子Agent支持双向通信,用户可以排队、编辑待发消息或随时插话、中断任务,Web端补上了文件上传与侧边栏预览,实验性的Agent Teams也以插件形式开放。

这些更新指向同一件事:**DeepSeek交付的是一整套模型加Harness方案,150个工程岗位集中在服务端与Agent弹性计算,落点正在这层交付能力上。**后面再看五道题的成绩,也应该把模型和这层Harness当作一个整体来评估。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

评测结果:初版快,收尾慢

测试方式跟ZPedia此前保持一致:模型只能拿到题目和素材,需要自己写代码、运行并做自检,过程中记录它卡在哪一步、返工了几轮、最后要不要人接手。五道题的难度从还原一张网页截图起步,逐步加码到数据处理、规则模拟和视频生成。

Case 1:一张截图,还原 NASA 网页

给模型一张NASA「Webb Images」截图和一句提示词,让它做成单文件HTML。我们只验收首轮成品,不追加纠错提示;打开后对照原图,逐项看文字、布局和视觉差距。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Case 1:生成的NASA「Webb Images」页面:双层导航、图片分类入口与底部星系图。

V4.1 Flash抓住了页面的主要结构:黑色双层导航、左侧标题与介绍、右侧两列分类入口,以及底部星系图,都能在成品里找到。导航配色和星系图保留了原页面的辨识度,内容分区也没有跑偏。

差距主要在比例。导航和正文字号偏小,内容集中在较窄的区域,右侧留白偏多;底部图片占据的高度又明显增加。单个元素大体齐全,但组合起来,原图宽松、舒展的布局被压紧了。这道题里,它对页面结构的理解比较到位,对尺寸和留白的控制仍显粗糙。

Case 2:给运营数据做一个驾驶舱

提供7天、4个模型的数据,要求做出离线可用的运营驾驶舱。我们会核对指标和异常,改动筛选条件检查图表联动;成本模拟则要求模型单独验算,不能改动真实数据。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Case 2:驾驶舱总览:五项核心指标,以及请求量、成功率、成本—质量和请求占比四类图表。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Case 2:驾驶舱下半屏:异常事件、成本情景模拟器与运营数据明细。

这项交付的核心读数比较扎实。默认视图的五项指标都与基准一致:44.42万次请求、98.47%成功率、21,350美元总成本、2,054ms加权P95和4.32质量分,成本模拟的计算结果也准确。页面从总览指标、四张图表一直排到异常事件和数据明细,业务信息交代得较为完整。

四个模型在图表中用不同颜色区分,异常列表和成本模拟器并排放置,查看运行状况与讨论成本有了各自的位置。比较拖累体验的是信息密度:明细表的小字很密,部分坐标和图例又压在深色背景上。大字指标容易读,往下追踪具体数据时就明显困难。

Case 3:让 12 个人按规则撤离

给定建筑场景和规则,做一个12人疏散沙盘,实时计算寻路、烟雾和出口排队。检查时会开关门、暂停和单步运行;换成不同倍速,同样条件下的结果也应一致。

📹

Case 3:视频展示疏散沙盘运行,左侧展示人员、门与烟雾,右侧呈现撤离人数和出口统计。

疏散沙盘把关键状态变化交代清楚了。随着仿真推进,人员向出口移动、烟雾逐步扩散,右侧人数和出口统计随之更新。最终11人撤离,11号人员留在关闭的D4附近并被标为受困,与这套场景的预期一致。关门造成的影响,同时落在了地图、人员状态和最终统计上。

展示方式也比较实用:左侧看空间关系,右侧看撤离、排队和受困人数,两个出口各自记录通过量,事件日志补充过程,末尾再给出结果摘要。读者既能看到人往哪里走,也能知道过程停在了什么状态。这种把规则变化解释清楚的能力,是这项交付最突出的地方。

Case 4:做一只可以玩的 3D 魔方

用原生网页技术做一个3×3×3魔方,支持打乱、转动、撤销重做和逆序复原。隐藏测试负责核对状态,实际操作再检查快速连按、暂停时会不会丢步,以及动画有没有同步。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

Case 4:魔方训练器初始界面:中央为3D魔方,两侧提供算法输入、六面转动与执行队列。

魔方这题的亮点在操作区的组织。中央展示魔方主体,左侧安排打乱、算法输入与播放控制,右侧将六个面的转动分组列出,顺转、逆转和180度操作一目了然。顶部集中显示状态、步数、计时和队列,下方保留历史记录与打乱公式,训练过程中需要关注的信息都有明确位置。

视觉上,橙蓝两面反差鲜明,块体之间的间隔清楚,深色面板也衬出了魔方主体。不过,初始视角偏低,主要露出正面和侧面,顶面几乎不可见,三维结构的展示还不够充分。把观察角度稍作调整,空间关系会比现在更直观。

Case 5:把异常数据做成 15 秒短片

依据事件数据和品牌素材,制作一支15秒、1080p、30fps的MP4异常复盘短片。验收时按时间轴抽帧核对数字和变化方向,再完整播放,检查文字是否读得清、转场是否顺畅。

📹

Case 5:生成的15秒异常复盘短片,依次呈现两次异常、恢复指标与品牌片尾。

短片把15秒的复盘顺序安排完整了:从品牌片头进入两次异常,再展示恢复数据,最后收束到品牌文案。两个异常阶段的延迟、成功率和成本变化都与素材一致,严重和警告也区分清楚。恢复页准确呈现2,448→2,006ms的延迟下降,以及成功率提升0.61个百分点,数字和变化方向都明示出来。

视觉表现上,大字卡片负责突出读数,曲线补充变化趋势,异常与恢复阶段用不同颜色区分,观众比较容易跟上信息。深色网格、卡片和品牌元素也保持了统一风格。明显的瑕疵集中在恢复页:图例和横轴小字出现方框乱码,打断了整齐的画面。主体信息已经讲明白,字体细节仍拉低了成片的精致程度。

五道题的结果指向同一个判断:模型把功能做全、把数据做对的把握已经很高,驾驶舱读数准确,疏散状态跟得上关门,短片讲清了异常与恢复,网页和魔方的效果也能及格。差距集中在收尾环节,比例、密度、视角、字体,每处改动量都不大,都要靠人工逐项校对。

耗时分布也印证了这个判断:初版大约15分钟就能成形,进入自检和返工后,45分钟还没有跑完。**生成环节只占整个流程的一小段,其余时间几乎都花在反复对照和修正上。**用模型快速验证想法、试探方向,效率优势很明显;若目标是交付成品,推理效率还是有待提升。

把开源、架构、Harness和五道评测放在一起看,V4.1 Flash这轮给出的是一套组合方案。CED架构下,模型在prefill阶段只激活8B参数、decode阶段激活16B,KV Cache明显缩小,部署成本随之下降;原生多模态和空间感知把任务类型从文本推到了网页、三维重建和视频;Harness则在模型外面补齐工具、上下文和多Agent调度,150个工程岗位的落点也在这层交付能力上。

能力面铺得很开,短板同样清楚:五道题的首版都能在十几分钟内成形,把比例、密度、视角和字体逐项校对到可交付,却要再花上几倍时间优化。下一步要看的,就是模型能不能把这段收尾交给自检闭环,把成本优势兑现成稳定交付。

来源:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板