腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

阿若Arrows阅读约 8 分钟

本文转载自微信公众号「阿若Arrows」,点此查看原文。

昨天下午吃完饭小睡了一会,回到电脑前打开一看,立马不困了

hy4预览版上线了

首发已经上线了workbuddy和codebuddy并且前两周免费试用

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

先是Ox Alpha的两周免费刚刚结束,现在腾讯的hy4又来接力了

这半个月也是实现token共产了

时间点还很巧hy4在28号发布,27号就是欧洲最大的游戏展gamescom2026的开幕式。阿若作为一个游戏迷这两天也看了很多游戏厂商在讲述自己之前在amescom找到了很多制作游戏的灵感。

那今天测试hy4也不看什么数据了

就恰好就用hy4扮演一家中国独立游戏工作室,在参加完gamescom2026实现从展会之后进行调研、商业分析、可玩游戏原型制作和临时变更压力测试的游戏制作全流程。

先说结论,Hy4 整体能力很强,面对复杂需求也能保持较好的完成度。不过,它的细节稳定性仍然不足,产出通常还需要人工复核和打磨。

那么话不多说一起来看看hy4的表现如何吧

第一阶段:热点调研与事实核查

第一阶段,我没有急着让HY4做游戏,而是先把它扔进了一场还没有结束的展会。

我选的是Gamescom 2026。测试开始时,闭幕数据和获奖名单还没完全公布,媒体也在互相转载。我更想看它知不知道哪些东西不能下结论。

我让它扮演一家中国独立游戏工作室的研究负责人。团队5人,预算200万元,周期12个月。脱离这些限制谈机会,很容易得到一份根本做不出来的报告。

整理 Gamescom 2026 的重要公告并核对来源,分析趋势,为这支团队提出产品机会。不得把传闻写成事实,来源冲突必须保留,无法确认的内容标记为未知或未完成。

HY4 先交出了一张来源登记表。52 条来源分成 A、B、C、D 四级,14 处冲突单独保留。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

接着是一张 156 行、17 个字段的公告数据库,每个项目都带来源和冲突备注。其中 100 条被标成官方确认,56 条是媒体报道,没有收录传闻。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

87 个项目是新 IP,占 55.8%。已披露玩法的 60 个项目里,18 个带合作元素。已披露商业模式的 73 个项目里,64 个采用买断制。HY4 没停在报数字。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

它判断合作玩法适合传播,但自建联机会迅速吃掉预算。真要做双人玩法,就优先本地双人和 Steam Remote Play。小团队更需要一个 30 秒内能被记住的动作或画面。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

它给出三个方向,并把《灶火》排在第一位。这是一款双手操作的中式面点经营游戏,核心不是堆系统,而是把揉、擀、包做出手感。

它还生成了一份事实核查报告。4 个凭印象补全的字段中,3 项被退回未知,另一项重新取得两个来源才保留。面对可疑内容站,它也没有硬编收入数字。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

当然,这轮也不是全过。我复查后发现,100 条官方确认里有 20 条没有直接挂接 A 级来源,其中 5 条只有 C 级来源。HY4 会建立规则,也会暴露缺口,但还不能保证每一行都执行到底。

所以我的评价很直接,长链整理、跨文件归纳和自查很强,但发布前的人工复核还省不了。

接下来我会把这些材料重新交还给 HY4,让它进一步分析做成一份一个具有专业媒体品质、可以公开展示的互动数字专题。

第二阶段:一份互动数字专题,看看究竟什么游戏有价值

第一阶段结束后,我没有把那五份文件收进文件夹,而是把它们原封不动地继续交给 HY4。任务变了。它不再只是做研究,而是要把表格、报告、来源和产品机会重新编排成一份可以直接对外展示的互动数字专题。

把第一阶段的五份交付物转化为一个本地可运行的互动专题。保留事实、推断与主观判断的分层,关键结论必须能回到来源,不用未经核实的数据补全页面。

下面这段完整录屏,就是它交出的成品。

📹

从 HTML 和 JavaScript 的实现看,这不是一张只负责好看的长图。页面把内容拆成基本盘、时间线、数据解剖、关系图、公告图鉴、趋势、独立观察、机会洞察和方法边界九个区块。

156 条公告与 52 条来源都写进了本地数据文件,筛选、搜索、排序、卡片抽屉、时间线、桑基图和发行商关系图也都有对应逻辑,不是静态占位。

我觉得做得最好的一点,是第一阶段的研究边界没有在网页里消失。事实、推断和主观判断有三套明确的视觉标记,来源编号可以点开查看,14 项冲突和 8 项未完成内容也被放在页面里。

它在工程上也考虑得比较完整。字体、图表库、粒子效果和数据都放在本地,没有依赖外部 CDN。

但完成度高,也会制造一种错觉。首页把 64.1% 的官方直接确认做成了醒目的大数字,可我在第一阶段复查时已经发现,100 条官方确认里有 20 条没有直接挂接 A 级来源,其中 5 条只有 C 级来源。

放在表格里,这是几行需要补证的数据。放进一个看起来很完整的专题页里,它就更容易被读者当成已经盖章的结论。

另一个问题是编辑节奏。公告图鉴把 156 条项目全部接了进来,证明数据确实连通了,但这一段会非常长。

所以这一阶段真正显示出来的,是 HY4 能接着上一阶段继续工作,把多份办公交付物编排成一个能运行、能追溯、能交互的成品。

它新增得最多的是结构、界面和传播效率,关键数字的证据强度与整页的阅读节奏,仍然需要人来把关。

第三阶段:制作可玩原型

做到这里,HY4 已经从一场还没结束的展会里整理出了研究材料,又把材料做成了一份可以交互的数字专题。

但这两件事都发生在办公软件和浏览器里。它能不能再往前一步,真的进入游戏引擎,把自己找到的机会做成可以玩的东西?

我把第一阶段排在首位的《灶火》重新交给它。这次不接受 HTML 2D 小游戏,也不接受只有画面的概念演示。我要的是一个能在 macOS 独立运行、有完整玩法循环的 3D 原型。

根据第一阶段选出的《灶火》方向,使用正式游戏引擎制作一款可以运行的 3D 拉面原型。核心循环需要覆盖接单、揉面、拉面、出餐和评分,作品应能够在 macOS 独立运行。制作过程中自行测试、修复问题,并保留尚未解决的限制。

下面这段完整录屏,就是 HY4 最终交出的试玩版本。

📹

我玩过这个游戏之后,第一反应其实很简单,这回真的是个游戏了。确实是一个能在Godot里跑起来、能导出成macOS应用的3D原型。

从菜单进厨房,接下老马的 4 股大宽到陈师傅的 16 股二细。揉面、拉伸、对折、下锅、评分、打烊,一条完整的游戏循环被塞进了 52 秒里。规模不大,但它至少没有停在概念上。

真正让我觉得有意思的,反而是那些没做对的地方。第一版面条用了 Verlet 物理,鼠标一动就断,体验大概就是「我还没拉呢,怎么先碎了」。HY4 没有继续硬修,而是换成解析曲线。

断条也从直接失败改成了自动回弹,面条悬在碗上的问题,改到真的落进汤里才停。

这一步,挺关键。

因为做游戏最麻烦的从来不是把代码写出来,而是发现一套方案不好玩以后,愿不愿意推倒重来。

HY4 在这一轮里表现出来的,不只是会写 GDScript,而是能自己测试、发现问题、换方案,再把一个能运行的版本交回来。

998 分也好,录屏里的两个 S 评分也好,都是它用自己制定的规则给自己打分。看着很爽,但还不能当成玩家评价。

画面也是一样。深色拉面馆、木纹案板、灯笼和热汤已经有了统一气质,但揉面时的白光有点过头,4 股面在远处还是容易看成两团,手机上看订单文字也偏小。有完成度,也有很明显的原型感。

所以我对这一阶段的评价会比 S 更克制一点。HY4 已经能从一份调研报告出发,走进正式游戏引擎,做出一个可以继续迭代的原型。

第四阶段:临时变更压力测试

游戏刚能跑,我又临时改口了。

这次我把自己换成发行商,还要求补上完整手柄支持和色觉辅助。

核心玩法不能动,不准推倒重做,技术修改只给 30 分钟。我要看的不再是 HY4 会不会从零做东西,而是项目已经成形以后,它能不能接住一串临时变更。

在现有《灶火》原型上完成发行商变更。增加完整手柄操作和色觉辅助,保留原有核心玩法,不得推倒重做。技术修改限时 30 分钟,并回归验证原有键鼠操作没有失效。

下面这段视频,就是改完后的手柄版本。

📹

这次变化看得很直接。菜单和揉面改用手柄 A,拉面变成左摇杆控制方向、RT 控制抓取,Start 可以暂停。

打开色觉辅助以后,界面又多了形状、文字和刻度。整套流程重新跑了一遍,原来的拉面玩法没有被拆掉。

我觉得这轮最像真实开发的一点,是 HY4 先判断哪些地方能动。核心玩法不碰,只改输入和 UI。核心代码在 29 分钟内完成,48 项回归测试全部通过。

完整测试、修错和导出其实花了 57 分钟,它也没有把超时藏起来。

当然,机器上没有接物理手柄,测试用的是注入事件,录屏也是脚本驱动。它能证明按键和流程工作,不能证明摇杆与 RT 的真实手感。

Xbox 键位提示、改键、震动和掉线处理也都还没做完,色觉辅助同样只有一种模式。

写在最后

四个阶段跑下来,我现在如果只用一句话评价 HY4,大概是,它已经很像一个能独立推进项目的执行者,但还不是一个可以彻底放手的负责人。

它的强项很明显。面对一个模糊目标,它能自己找资料、拆任务、产出文件,再把上一阶段的结果继续往下用。

52 条来源和 156 条公告没有停在表格里,它们变成了互动专题,又变成了《灶火》的产品方向。游戏做出来以后,临时加手柄和色觉辅助,它也能接着原工程改,不需要重新开始。

更难得的是,它并不只会一口气往前冲。来源冲突会登记,无法确认的字段会退回未知,物理方案不成立就换成解析曲线,临时改输入以后还会补回归测试。

这种连续工作和自我修正,才是 HY4 在这次测试里最亮眼的地方。

短板也很清楚。它能建立一套很漂亮的规则,却不一定把规则执行到每一行。第一阶段那 20 条缺少 A 级来源的官方确认,就是最直接的例子。

到了游戏阶段,自动脚本可以跑出 S 评分,注入事件也能让 48 项测试全部通过,但它们依然代替不了真人玩家和物理手柄。

这也是 HY4 最需要警惕的地方。

它太擅长把东西做得像成品了,网页越漂亮、数据越完整、评分越高,人就越容易忘记追问,证据真的够吗?完成度会增强说服力,也会把没验证的部分一起放大。

所以我不太会把 HY4 当成一个替我做决定的人。还需我负责做复核,再给那个看起来已经完成的结果多问一句,真的可以交出去了吗?

HY4 可以把第一碗面端上来。

但好不好吃,还是得人来尝。

我是阿若,持续实测最新 AI 产品,分享可复现的工具用法。少追概念,多看效果,让每一支箭头都指向真实生产力。