一张照片生成能进去的 3D 场景:最快 4 秒出一个资产

一张照片生成能进去的 3D 场景:最快 4 秒出一个资产

过去一年,把一张图变成能环视一圈的三维空间,已经有不少惊艳的演示。但演示归演示,真要拿去用,问题马上就来了:会议室照片转成的 3D 模型里,桌椅、电脑、水杯往往和背景整个「黏」在一起——它更像一件只能看、不能动的立体布景。

9 月 1 日,上海 3D 生成公司影眸科技(Hyper3D)发布世界生成模型 Hyper3D WorldGen,直接冲着这个问题去:一张图进去,出来的场景里每个物体都是独立、可编辑、可替换、可交互的资产。

两三分钟,一个能拆开的场景

先说体验流程。上传一张场景图片(真实空间照片,或者一张想象中的概念图都行),系统会自动识别画面里的主要物体,也可以手动框选指定要生成哪些。

速度是:每选中一个物体,两三秒后出现初步的 3D 预览;一键生成包含十几个甚至二十个物体的完整场景,大约两三分钟。

关键在于结果的结构。以前模型会把整张图烘成一个整体,WorldGen 则把主要物体分别生成,再放回各自的位置。桌子是桌子,椅子是椅子,水杯是水杯——每一个都能单独挑出来编辑或替换

难的不是生成物体,是让物体懂物理

把图片里的东西一个个变成 3D,其实只是起点。真正的难点在于:一张图片能让模型看到杯子放在桌上,却不会告诉模型杯子的质量分布和摩擦力是多少;能显示两本书斜靠在书架上,却没有写出是谁在提供支撑、怎么摆才不会悬空或穿透

决定一个场景能否稳定存在、能否支持真实交互的大量信息,在图像里根本没有直接信号。

WorldGen 的做法是:在后台建立物体关系图,识别接触、支撑、悬挂等关系,预测每个物体在同一空间里的位置、尺度和朝向,再做基础的物理校正,减少穿模、悬空和不合理堆叠。

官方演示里有两个画面很能说明问题:两根柱子叠在一起,抽走下面一根,上面的柱子会随之倒塌抽屉里的东西被打翻,会滚落到地面,而不是悬在空中

技术底子:一篇 SIGGRAPH 最佳论文,加一年工程

这套能力源自影眸团队 2025 年发表的研究 CAST(《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》),由上海科技大学与影眸(Deemos)合作完成,核心是从单张图像出发,构造由多个独立、完整、可交互物体组成、且物理关系合理的 3D 场景。

这项研究拿下了 SIGGRAPH 2025 最佳论文。同期获得该奖项的商业公司,全球只有三家:谷歌、Meta 和影眸。

但从论文到产品用了一年多,原因很实在。联合创始人兼 CTO 张启煊的解释是:场景生成是一个多模块的复杂系统,假设每个模块成功率都有 95%,五个模块串联起来整体成功率就会明显下降。CAST 在框架上解决了大部分问题,但当时有冗余模块,独立模块之间的错误也会累积,一度无法产品化。这一年做的是减少模块、提升各环节稳定性,最后才跨过产品化的门槛。

两个设计取舍,都很聪明

其一是混合表达。需要移动、编辑和交互的主要物体,用 Mesh 生成——它有实体结构,能附加物理属性,也更容易进主流 3D 管线;天空、远景和不需要交互的背景,则用 3D 高斯泼溅(Gaussian Splatting) 补全,保留更多环境信息和沉浸感。

用一句话概括就是:要「用」的部分交给 Mesh,要「看」的部分交给高斯。只用 Mesh,背景容易显得空;全用高斯,画面虽然完整,但物体缺少实体结构,没法做物理仿真。

其二是精度可分配。基于 Hyper3D Rodin Gen-2.5 首次提出的 thinking effort(思考深度)架构,场景里每个资产都能按需分配生成精度:最快 4 秒就能生成一个可用的 3D 资产,也可以花 40 秒甚至 80 秒补充更多表面细节。

这意味着你可以先用低时延模式看整体结构,再挑出关键物体继续精修。一个远处的花瓶和一个需要特写的主角道具,不必消耗同样的时间和算力。场景生成不再是一次成本固定的「抽卡」。

能接进现有工作流,这是关键

生成出来的资产不是锁在工具里的,它们可以直接进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎环境,做材质调整、动画绑定、关卡编辑、性能优化等二次创作。

三个落地方向已经跑起来了:

影视制作——多镜头叙事的一致性问题,视频模型一直解决得不好:镜头切换后飞船结构可能变了,道具位置可能挪了。WorldGen 的解法是先建一个空间结构稳定、资产彼此独立的 3D 场景,在里面调镜头、调整构图、移动角色与物体,确定空间关系后再交给视频生成模型补材质、光影和风格。这更像一张「3D 导演台」。已经有创作者用「WorldGen + Seedance 2.5」的工作流为新加坡音乐学院制作宣传片,用于商业项目。它还配了 AI Render 模块,支持自由运镜。

游戏与 XR——小团队搭一个关卡,过去需要分别制作或购买资产、再由专业人员摆放调材质。现在可以先把场景搭出来,每个 Mesh 资产仍能独立导出。今年 7 月影眸已与 Unity 中国(团结引擎)宣布合作。

具身智能——作为 NVIDIA Inception 成员,影眸此前已借助 Omniverse 与 Isaac Lab 上线 Sim-Ready,并推出 Isaac Sim 官方插件。WorldGen 把「一个资产进 Isaac Sim」推进到「整个场景进 Isaac Sim」。今年 7 月,影眸联合地瓜机器人、谋先飞发布「具身智能可训练仿真闭环联合解决方案」:WorldGen 从真实照片重建场景并生成可导入仿真的资产,谋先飞用自研物理引擎 MotrixSim 完成仿真适配,地瓜机器人提供算力底座与工具链。此外影眸参与的 cuNRTO 研究获得 2026 年 RSS 最佳论文提名。

同日另一件事:VAST 融资 30 亿

同一天,3D 大模型公司 VAST(三启万物)宣布完成合计约 30 亿元人民币 的 B 轮和 B+ 轮融资,并同步发布旗舰模型 Tripo P2.0,首次实现原生四边面拓扑网格的端到端生成。

两件事撞在同一天不是巧合。今年以来,谷歌开放 Genie 3 体验、World Labs 发布 Marble 1.1、腾讯开源混元 3D 世界模型 2.0、阿里发布 HappyOyster 1.0、字节推出 Seed3D 2.0——巨头与资本密集涌入,3D 生成正在从「生成单个资产」迈向「生成完整世界」。

⚠️ 它现在还不完美

必须如实说清楚几点:

物理属性是估计值。官方明确表示,质量、摩擦系数这些更接近人看到一件物品时的直觉判断,属于「猜测的估计值」,暂时不能作为精密的工业测量结果,但足以支撑基础的物理仿真。

擅长刚体,柔性还不行。现阶段 WorldGen 主要擅长生成刚体,搭出一个能继续运行和修改的空间骨架。直接拧动水龙头、衣服自然褶皱这类关节化资产、柔性体和动态交互,还在技术路线图上。

透明与柔性材质仍是短板,复杂场景的成功率也还有提升空间。

定位很清楚。创始人兼 CEO 吴迪明确区分:WorldGen 不会改变公司定位,影眸仍然是一家 3D 生成公司,不是具身公司,也不是世界模型公司。

对普通人意味着什么

最直观的变化是:过去只能被观看的一张图片,现在可以变成能进入、能编辑、能交互的三维空间

对做内容的人,多了一条新路径:先用 3D 把「世界里有什么、东西放在哪、镜头怎么走」固定下来,再让视频模型去补画面表现。现实里存在的空间可以扫描,不存在的空间(科幻场景、概念设计)可以由 WorldGen 直接生成——两者都能先形成可控的 3D 基底,再接入后续流程。

对小团队,它降低了验证成本:不必先配齐完整的美术工种,也能快速验证一个关卡或者一个世界设定。

而对整个行业来说,3D 生成的竞争焦点正在迁移——从「第一眼像不像」,走向「生成一个物体之后还能做什么」。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。