本文转载自微信公众号「夕小瑶科技说」,点此查看原文。
家人们,GPT-6 出来以后,我最近真是被各种案例刷得越来越上头。
比如通关一整款游戏,搭出一辆蒸汽火车,把汽车拆成几百个部件,甚至还有人用它在 Photoshop 里画画……
离谱的玩法一个接一个。
越看越觉得,以后GPT-6 Astra 的正确打开方式,也许就是:直接把电脑交给它!
一天通关《传送门》游戏
《传送门》这款游戏,它真的从开局打到了结尾。公开运行记录:23 小时 43 分,差不多一整天。GPT-6 Astra 真的把它玩通关了。
这是款第一人称解谜游戏。场景里有机关、有障碍,需要把传送门开在合适的位置,让角色和物体穿过空间,找到继续往前走的办法。
开发者 cozyblaze 做了一个测试:让 GPT-6 Astra 亲自上手这款第一人称解谜游戏。模型自己看屏幕、自己规划、自己发一串操作指令。

因为模型每次"停下来想"的空档都被剪掉了,剪出来的精华版只有 2 小时,看画面里它的动作又准又稳,简直像开了外挂。

在这场测试中,GPT-6 Astra 要观察眼前的场景,决定往哪里走、视角往哪边转、接下来操作什么。动完了,再看结果,继续安排下一步。
为了这场测试,这个开发者烧了约 571 美元的用量。
一周在电脑里“造城”,目标直接放到曼哈顿
虽然花费不少,但是让 GPT-6 Astra 通关一整款游戏,已经够让我震惊了。
结果有创作者使用 GPT-6 Astra 来搭游戏世界,这次,目标直接放到了曼哈顿。
创作者 Matt Shumer 使用GPT-6 Astra、Codex和Unreal Engine 用了一周时间持续搭建曼哈顿城市场景。
📹
Unreal Engine 也就是制作游戏和三维场景的虚幻引擎。GPT-6 Astra 配合 Codex,在里面持续搭建城市街景。
公开演示中的曼哈顿场景,是在一周里逐步搭出来的。画面切到街道里的时候,我还真看愣了一下,恍惚以为自己点开了哪款游戏的实机演示。沿街的楼房、外墙上的消防梯,连屋顶的水箱都搭了出来。
这背后,还有一套挺有意思的分工。Matt Shumer 把工作交给两个独立的 Codex 会话,让它们配合推进。
一个像项目经理,负责把大目标拆成阶段和待办清单,安排眼下先做什么。
另一个负责动手搭建,边做边检查,再把完成情况交回来。遇到需要分头处理的任务,还能找其他代理帮忙。
这就有点像,一个盯着工程进度,一个在现场干活。
GPT-6 Astra 秒杀所有验证码
接下来这个更奇葩。
有人用 GPT-6 Astra 跑去玩了网站验证码《我不是机器人》。

这是在 Neal.fun 上一款把验证码做成关卡的小游戏。GPT-6 Astra打通全部的48关。
下面展示了打通的结果,可以看到里面的任务还一直在变,一会儿要下井字棋,一会儿要打地鼠,得跟着新的要求换玩法。
📹
最有喜感的是结尾。
游戏给它发了一张证书,上面写着:VERIFIED HUMAN,已验证为人类。

一个 AI,打完 48 关,领走了一张“真人认证”。
虽然这里通关的是小游戏,不能据此认定真实网站的验证码都失效了。
但从演示来看,屏幕上的规则和任务不断变化,它仍然完成了这一串挑战。看懂要求之后,再换一种操作方式继续做,这真的很难让人不警惕。
GPT-6 Astra 操控 Blender 排好走位和镜头,再用 AI 生成视频
然后下边这个案例,看到后我真想抄作业。
📹
经常做 AI 视频的都会遇到这种情况:画面挺漂亮,人物却没走到该去的位置,镜头也没跟上。改提示词,再生成一次,又开始“抽卡”。
在这个案例中 GPT-6 Astra 先根据场景要求,操控 Blender 软件搭出简化的三维空间,放好人物,确定他们在场景中的位置。
接着,根据镜头清单安排人物怎么走、摄影机放在哪里、镜头怎么移动。把这些安排播放出来,就能提前看到:人物有没有走到该去的位置,镜头能不能拍到想要的画面,前后的动作是否衔接。这个阶段完成的是白模预演。

随后把白模预演的内容再交给 Seedance 2.5 生成正式镜头,从而提高视频生成的稳定性。
我喜欢这套方法,是因为它给“生成不稳定”找到了一个具体的处理方向:把能确定的部分先固定下来,让视频模型少猜一点。
对于走位和运镜要求明确的视频,这样有机会少做几轮无效重试。
前面多一道预演,后面可能就少花些反复生成的时间和费用。
照着一张图纸,搭出一辆可编辑的蒸汽火车
在接下来是讨论度最高的3D建模能力。GPT-6 Astra 在这方面又上升了一个高度。
Tom Krcha 给它一张蒸汽火车图纸,要求在 Blender 里重建。Blender 是制作三维模型和动画的软件。GPT-6 Astra可以直接打开软件进行操作。
演示中,烟囱、锅炉、车轮和驾驶室被搭了出来,一辆火车出现在软件窗口里。
📹
几分钟后,这个场景里有了 3295 个可编辑对象。
随后,他又让 GPT-6 Astra 把模型拆成部件。演示中的火车随之展开,各部分分离出来。
把特斯拉 Model X 做成能拆开查看的 3D 网页
3D建模后还能再往前走一步,还可以变成一个能玩的网页。
另一位创作者 ashe,则把一辆特斯拉 Model X 做成了可以拆开的网页。
比如这辆特斯拉 Model X。
滑杆一拖,汽车外壳、玻璃、车轮逐渐散开,页面显示 334 个可选择的模型部件。转一转,换个角度看;点开某个部分,还能查看说明。
📹
这个网页真的很适合拿来做产品介绍了,一件东西由什么组成,各部分在哪里,直接展开来讲。
想象以后所有的知识类都可以做成类似的交互。我们可以根据手里已有的三维素材,尝试做成展品介绍、产品展示,或者一页能互动的科普。
在 Photoshop 里复绘《戴珍珠耳环的少女》
最后最有趣的案例:创作者 Zho 前一天让 GPT-6 Astra 在 Photoshop 里画《戴珍珠耳环的少女》,对晒出的简化临摹结果一通调侃。

结果第二天,他又发布了复绘演示,态度直接变了。
“这下好了,它真会了!”

我的第一反应是:不是,连这个它也会了?看着它把画一点点画出来,我还真有点慌。
看完这些案例,只能说,网友们是真没打算让 GPT-6 Astra 闲着。
至于后面还能出现什么离谱案例,我已经不敢预测了,怕自己的想象力先露怯。
但有一点越来越清楚:操作软件的门槛正在慢慢松动。
过去我们得花几年学会 Blender、学会修图、学会写代码,才能把脑子里的东西做出来。
现在 GPT-6 把这些专业软件当成它能上手的工具,我们只要描述得出"想要什么",它就能一步步把它做出来。
以前那些被一句“这个软件我不会”劝退的想法,或许可以重新拿出来试试了。
以后我们如果冒出一些奇奇怪怪的想法,也许真可以像开头说的那样:直接把电脑交给它,看看它能折腾出什么来。


参考文献
[1] Portal 通关记录与项目: https://github.com/cozyblaze/portal-agent
[2] Neal.fun:我不是机器人游戏: https://neal.fun/not-a-robot/
[3] Photoshop 复绘演示: https://x.com/ZHO_ZHO_ZHO/status/2096900358169894916