GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

风雪之隅阅读约 4 分钟

本文转载自微信公众号「风雪之隅」,查看原文。

GPT-6 Astra 发布以来最火的是建模。它在Blender里自己写脚本、跑渲染、看效果、改—改,然后一栋住宅就建好了。

当然,也有人说,异性结构还不行,细节问题很多,中看不中用等等。

了解的同学大概知道我过去几年开始创业做如视(Realsee),而我们如视做的就是实景三维重建的一种,大家在贝壳找房上看到的VR看房,美团上看到的餐厅预订VR等就是我们的工作,所以这几天我做了一组测试:给定真实采集的空间数据,Astra的重建能力到什么程度,边界在哪。

案例-住宅

我挑选了一套新房样板间,采用如视伽罗华P4采集,数据包括24K HDR全景图,高精度点云,Mesh等16种数据(4.3GB):

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

我把伽罗华P4采集和产出的 16 类数据(全景图、HDR Raw、深度图、六视图、Mesh、点云、位姿、3DGS、物品识别、户型图、CAD、反射率、多光谱等)一次性给到 GPT,由它判断"需要哪些"。GPT 的选择逻辑是按用途分工:

平面图确定房间结构 → 点云和深度约束形状 → 识别结果帮助定位物品 → 全景和截图指导造型与材质。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

第一轮:使用“户型图 + Mesh + 户型 JSON + 模型压缩包”

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

可以看到还是不太行,无论物体,户型格局,颜色,材质都不太对。

第二轮:沟通问题,补充图像,点云,深度图数据

和GPT沟通生成问题,哪些方面还原的不好,以及它需要我再补充哪些数据能帮助项目优化。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT倒是很快理解了,它使用点云、深度图和高清全景图能优化哪些问题。收到新的数据之后,新的输出结果比第一轮提升了很多:

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

上面是伽罗华真实拍摄的24K HDR全景图,下面是GPT6虚拟渲染出来的效果。可以看到到这一步,整体布局,家具的种类,颜色,材质,朝向,都基本正确,甚至窗外的景色都做到了相似。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

并且所有的物体都有单独的模型,可以拆分。我感觉每一个家居都经历了:

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

总的来说:虽然细节上还有很多小问题,但整体上乍一看已分不清虚拟和现实。非常惊艳!

一个对照实验:只给照片会怎样

那既然 Astra 这么强,丢几张照片进去不也能行么?

我也试了。即使 prompt 明确要求高精度还原,仅有全景图输入时,GPT6结果是从图像理解出发、基于空间结构假设"猜"出来的。单个物品还好,但是N多物品在一个空间内拥有确定的几何关系约束的时候,关系的还原就会混乱,整体结构和细节看起来就会很粗糙。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

对比下来,给到GPT-6 Astra更多的数据:精细高清图像和对应的空间点云,空间的结构、测量尺寸、图像之间的位姿、布局关系,都是确定性的输入。输出质量就更高了。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

同一个模型,给它照片,它交出的是想象;给它高质量的数据,它交出的是工程。

对应到产出端自然就会带来:

空间结构确定性更高

激光扫描给的是物理空间的真实布局和联通关系,不是"图像推断"。Astra 建模时歧义更少,少走弯路,降低结构歧义与人工校正成本。

尺寸是毫米级,能直接进下游

硬件精度直接传递给模型。输出的 .blend/ .usd通用格式场景能量尺,可以对接下游更多应用场景。

物件可分割、可替换、可导出

每个物件都是独立资产,单件换材质、做动画、导出都行。而且数据源画质够高,物件纹理来自真实扫描的多视角观测——不是 AI 臆造出来的。

这事到底"能用"在哪

凡是需要"空间数据驱动决策"的场景,数字孪生就有价值。过去卡在三个字:

建模贵、周期长、精度不够用。

现在这三个问题,同时在松动。

图像可信、尺寸可信、结构可信、资产可分割——这四个词凑齐了,下游才敢接。仿真模拟、设施巡检、沉浸文旅、安全培训,包括具身智能的 Sim-ready 训练、游戏和影视创作,都能用同一份数据往下走。

最后:

最有意思的地方不是"AI 会建模了"(虽然瑕疵还多,但我相信随着AI的快速迭代未来都能克服)。

而是:当 AI 的行动力不再是瓶颈,瓶颈会回到数据本身。

注意这里的"数据"指什么:不是"有数据就行",而是确定性的、有尺度的、多视角的真实采集数据。模型越强,对数据质量的要求不是降低,是升高——因为它能利用的信息维度更多了。

当然,也不排除是我的使用姿势有问题,欢迎留言指出。

原文的「阅读原文」链接里是本文使用的案例,如果你想自己也试试,原始数据我找个地方放好后,会在留言内贴出来。