本文转载自微信公众号「AI维克兹」,点此查看原文。
今年 6 月底的时候,字节发布了豆包大模型 Seed2.1 系列。
相信很多小伙伴都有深入体验了。
它的通用 Agent 能力、Coding 进步速度非常明显。

不到三个月,Seed 2.1 Pro 又迎来了一次重大更新。
今天发布的版本代号是 Seed 2.1 Pro- 0915,目前 API 已全量上线火山方舟。

这回又该重新认识豆包了。
花了半小时快速过了文档。
先给大家梳理下相关核心信息,
然后再带着大家一起实测最新版本的效果。
重点在多模态 Coding 和 Agent
这次更新,主要加强了看图写代码、搭建 3D 场景和开发游戏的能力,工具调用加强了结果核验。
减少了还没拿到返回结果,就提前报告任务完成的情况。
Token 用量也降了。
图像与视频推理的 Token 消耗减少了 30% 以上。
这次测试,我用的是 Seed-Evolving API。
按官方的说明,它与 Seed 2.1 Pro-0915 的能力表现一致。
Evolving 会持续滚动更新,0915 则固定为一个稳定版本。
我把 API 接进 Claude Code,由 Seed 理解需求、生成代码,再通过Claude Code 操作文件和执行命令。

日常办公的任务,也放到豆包工作里试了试。
下面,来看看各种测试效果吧。
实测一:迷宫游戏
前段时间网上看到了一张有意思的地图,里面的路比较密,岔路和死胡同也多。

复杂的路线,最能测试模型的能力有没有进步了。
我把图片和提示词一起发给 Claude Code,让它照着做一个能玩的 3D 滚球迷宫。
图里的墙和通道要保留,小球有惯性和碰撞,镜头跟着走,右上角还得配一张实时小地图。
没多久,活就干完了,界面也生成了。
第一眼就戳中我的心坎了。
平面的迷宫立起来了,墙体、地面的阴影、小地图,都做了出来。
之前,我放弃 Claude Code 转战 Codex 的原因之一,就是当时用它处理图片的体验很鸡肋。
这次接入 Seed,发过去的图真能变成一个可以操作的 3D 场景,这一点我特别满意。
📹
讲真,我最喜欢的是那颗球。
球面带着花纹,往前滚、拐弯时,花纹会跟着运动方向转。
盯着这个细节,就能观察它到底往哪边滚。
按着方向键,小球会加速;松开以后,它会因为摩擦逐渐减速。
我实际玩的感觉,滚动的方向和这几个物理效果都挺顺畅。

右上角的小地图也比我预想的细,能看到小球的位置,还能看到刚刚走过的轨迹。
可惜,第一版的路不对。
小球实际通行的路线跟着小地图,主画面里的墙体完全成了摆设。
好一招障眼法,没有了寻宝图还真不一定走得出来。
我把这个问题再描述给它,顺便加了一条需求,让它支持人称视角切换。
再改一轮后,墙体和小球的通行位置对齐了,第一人称也加了进来。

视角一变,那种沉浸感也就有了。
之前是从上方看一颗球在迷宫里滚,现在镜头进了通道,两边都是墙,前面是路口。
要么老老实实地看地图找路,要么自己在里面摸索。
📹
这一版效果就好很多了。
实测二:简化给长辈看的说明书
做完迷宫游戏,我又拿了一份家电说明书,让它帮忙整理成适合长辈看的日常操作卡。
用的是空气净化器 4 的官方 PDF,一共 32 页,包含多种语言。

我的要求是把开关机、切换模式、调屏幕亮度、看滤芯状态这几个常用操作放进去,再配上按钮示意图。
生成的卡片是一张 A4,分成四块,字比较大,旁边配着从说明书里截出来的图。
看到这张图,长辈们至少知道从哪儿去找按钮了。

它还附了一份依据核对表,把操作说明对应到原 PDF 的页码和图示位置。
需要核对某个操作时,按表里的页码翻回去,就能找到原来的说明和配图。
从 32 页说明书里挑出常用操作、截图、圈出按钮,再排成一张 A4,这些整理工作它都帮忙做好了。
效果我能给打8分。
实测三:报名表优化
图文资料整理完,接着换一份活动报名表的任务,这次放到豆包工作里处理。
材料是我专门准备的虚构数据,总共 28 条,里面放了重复提交、空缺字段、取消报名等情况。

我让它清理数据,把需要核实的问题单独列出来,再做统计和图表。

整理完后,原始报名、清理结果、待核实清单和统计汇总,各放在一张工作表里。
同一个邮箱的不同报名,它处理得挺细。
同一场活动重复提交,它按最新记录更新状态,还标出了被替代的报名。
同一个邮箱报了两个场次,两条就分别保留。
缺姓名、缺邮箱等需要补充信息的记录,也单独列了出来,方便后面逐条确认。

最后统计出 14 条有效报名,对应 17 人,报名条数和人数分开计算。
与预先准备的答案对照,去重和有效人数都对上了,Excel 里的汇总公式也能正常计算。
这份表格任务完成情况我会给好评。
实测四:结合 Blender 做白模预演
最近,GPT-6 的爆火带动了一款建模软件的热度,Blender。
这还真是个好东西,我也是通过 GPT-6 才了解到这个工具。
趁着这次实测,我们就来试试。
Seed 能不能通过 MCP 调用 Blender,帮我把场景和镜头都做出来。
我给它的任务,是做一段屋顶追逐的白模预演。
先用简单的几何体把屋顶、障碍物和角色搭出来,安排角色怎么走、镜头怎么拍,渲染成视频以后,再交给 Seedance 2.5 做参考。
开工前,我先让模型检查 MCP 连接。

这个接口连通后,模型就能把操作送进 Blender 里执行。
结果检查出来,配置没好。
那就继续让它帮忙把 MCP 服务配好。
这一步做得挺顺利,连接打通后,再把搭建场景的提示词交给它。

它梳理任务时,在显示出来的思考过程里,先感慨了一句这是个大工程。
哈哈哈,它也知道活不少!

后面的建模、动画、渲染和视频导出,都继续做了下去,过程比较顺畅。
白模里,角色和建筑都是简单的形体。
这个阶段主要看它们的位置、运动路线,还有镜头拍出来的效果。

第一版出来,运镜我不太满意。
场景已经搭起来了,镜头拍出来还差点意思。
我就继续让它新增几个视角切换,把这段预演改好,给后面的成片做参考。
然后,我就得到了这样的一个渲染好的白模视频。
📹
我又把这个视频交给 Seedance 2.5 去生成。
成片出来,没想到运镜还真跟上了。
这次的效果里,镜头中人物的跑动路线和视角的切换,都跟着 Blender 里的安排走了。
📹
有了这样的一个流程之后,以后做视频,那些复杂的视角切换镜头,就变得简单多了。
如果是人物的运动路线和运镜不好,就让 Seed 继续改,满意后再交给 Seedance 生成。
Seed 负责调用工具、搭场景和修改预演,Seedance 2.5 负责后面的成片。
真的不要太完美!!
最后想说的话
这次升级版的 Seed-2.1-Pro 实测下来,我整体上还是比较满意的。
特别是在多模态 Coding 和 Agent能力上,确实上牌桌了。
自己提的迷宫,能切进第一人称走一圈。
自己安排的镜头,能先在 Blender 里预演,再做到最后的视频里。
做评测能留下这样的作品,还是挺有成就感的。
一个人折腾项目,经常会卡在某个自己不熟悉的环节。
其实,只需要看图、写代码、调用工具这些能力配合起来,卡点就能顺利解决。
这也让我惦记起了手头那些搁着的想法,打算再拿出来试试。
你可能也有几个一直没动手的点子。
建议先做出一个小版本,看看它跑起来的样子,
后面要怎么改,往往就有头绪了。
如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
我是维克兹,前程序员、现创业者。
目前主要关注 AIGC 人工智能,资深燃劲AI鼓励师,希望分享好用的AI工具,AI应用技能,激发你对AI的好奇。