过去一年,把一张图变成能环视一圈的三维空间,已经有不少惊艳的演示。但演示归演示,真要拿去用,问题马上就来了:会议室照片转成的 3D 模型里,桌椅、电脑、水杯往往和背景整个「黏」在一起——它更像一件只能看、不能动的立体布景。
9 月 1 日,上海 3D 生成公司影眸科技(Hyper3D)发布世界生成模型 Hyper3D WorldGen,直接冲着这个问题去:一张图进去,出来的场景里每个物体都是独立、可编辑、可替换、可交互的资产。
两三分钟,一个能拆开的场景
先说体验流程。上传一张场景图片(真实空间照片,或者一张想象中的概念图都行),系统会自动识别画面里的主要物体,也可以手动框选指定要生成哪些。
速度是:每选中一个物体,两三秒后出现初步的 3D 预览;一键生成包含十几个甚至二十个物体的完整场景,大约两三分钟。
关键在于结果的结构。以前模型会把整张图烘成一个整体,WorldGen 则把主要物体分别生成,再放回各自的位置。桌子是桌子,椅子是椅子,水杯是水杯——每一个都能单独挑出来编辑或替换。
难的不是生成物体,是让物体懂物理
把图片里的东西一个个变成 3D,其实只是起点。真正的难点在于:一张图片能让模型看到杯子放在桌上,却不会告诉模型杯子的质量分布和摩擦力是多少;能显示两本书斜靠在书架上,却没有写出是谁在提供支撑、怎么摆才不会悬空或穿透。
决定一个场景能否稳定存在、能否支持真实交互的大量信息,在图像里根本没有直接信号。
WorldGen 的做法是:在后台建立物体关系图,识别接触、支撑、悬挂等关系,预测每个物体在同一空间里的位置、尺度和朝向,再做基础的物理校正,减少穿模、悬空和不合理堆叠。
官方演示里有两个画面很能说明问题:两根柱子叠在一起,抽走下面一根,上面的柱子会随之倒塌;抽屉里的东西被打翻,会滚落到地面,而不是悬在空中。
技术底子:一篇 SIGGRAPH 最佳论文,加一年工程
这套能力源自影眸团队 2025 年发表的研究 CAST(《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》),由上海科技大学与影眸(Deemos)合作完成,核心是从单张图像出发,构造由多个独立、完整、可交互物体组成、且物理关系合理的 3D 场景。
这项研究拿下了 SIGGRAPH 2025 最佳论文。同期获得该奖项的商业公司,全球只有三家:谷歌、Meta 和影眸。
但从论文到产品用了一年多,原因很实在。联合创始人兼 CTO 张启煊的解释是:场景生成是一个多模块的复杂系统,假设每个模块成功率都有 95%,五个模块串联起来整体成功率就会明显下降。CAST 在框架上解决了大部分问题,但当时有冗余模块,独立模块之间的错误也会累积,一度无法产品化。这一年做的是减少模块、提升各环节稳定性,最后才跨过产品化的门槛。
两个设计取舍,都很聪明
其一是混合表达。需要移动、编辑和交互的主要物体,用 Mesh 生成——它有实体结构,能附加物理属性,也更容易进主流 3D 管线;天空、远景和不需要交互的背景,则用 3D 高斯泼溅(Gaussian Splatting) 补全,保留更多环境信息和沉浸感。
用一句话概括就是:要「用」的部分交给 Mesh,要「看」的部分交给高斯。只用 Mesh,背景容易显得空;全用高斯,画面虽然完整,但物体缺少实体结构,没法做物理仿真。
其二是精度可分配。基于 Hyper3D Rodin Gen-2.5 首次提出的 thinking effort(思考深度)架构,场景里每个资产都能按需分配生成精度:最快 4 秒就能生成一个可用的 3D 资产,也可以花 40 秒甚至 80 秒补充更多表面细节。
这意味着你可以先用低时延模式看整体结构,再挑出关键物体继续精修。一个远处的花瓶和一个需要特写的主角道具,不必消耗同样的时间和算力。场景生成不再是一次成本固定的「抽卡」。
能接进现有工作流,这是关键
生成出来的资产不是锁在工具里的,它们可以直接进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎环境,做材质调整、动画绑定、关卡编辑、性能优化等二次创作。
三个落地方向已经跑起来了:
影视制作——多镜头叙事的一致性问题,视频模型一直解决得不好:镜头切换后飞船结构可能变了,道具位置可能挪了。WorldGen 的解法是先建一个空间结构稳定、资产彼此独立的 3D 场景,在里面调镜头、调整构图、移动角色与物体,确定空间关系后再交给视频生成模型补材质、光影和风格。这更像一张「3D 导演台」。已经有创作者用「WorldGen + Seedance 2.5」的工作流为新加坡音乐学院制作宣传片,用于商业项目。它还配了 AI Render 模块,支持自由运镜。
游戏与 XR——小团队搭一个关卡,过去需要分别制作或购买资产、再由专业人员摆放调材质。现在可以先把场景搭出来,每个 Mesh 资产仍能独立导出。今年 7 月影眸已与 Unity 中国(团结引擎)宣布合作。
具身智能——作为 NVIDIA Inception 成员,影眸此前已借助 Omniverse 与 Isaac Lab 上线 Sim-Ready,并推出 Isaac Sim 官方插件。WorldGen 把「一个资产进 Isaac Sim」推进到「整个场景进 Isaac Sim」。今年 7 月,影眸联合地瓜机器人、谋先飞发布「具身智能可训练仿真闭环联合解决方案」:WorldGen 从真实照片重建场景并生成可导入仿真的资产,谋先飞用自研物理引擎 MotrixSim 完成仿真适配,地瓜机器人提供算力底座与工具链。此外影眸参与的 cuNRTO 研究获得 2026 年 RSS 最佳论文提名。
同日另一件事:VAST 融资 30 亿
同一天,3D 大模型公司 VAST(三启万物)宣布完成合计约 30 亿元人民币 的 B 轮和 B+ 轮融资,并同步发布旗舰模型 Tripo P2.0,首次实现原生四边面拓扑网格的端到端生成。
两件事撞在同一天不是巧合。今年以来,谷歌开放 Genie 3 体验、World Labs 发布 Marble 1.1、腾讯开源混元 3D 世界模型 2.0、阿里发布 HappyOyster 1.0、字节推出 Seed3D 2.0——巨头与资本密集涌入,3D 生成正在从「生成单个资产」迈向「生成完整世界」。
⚠️ 它现在还不完美
必须如实说清楚几点:
物理属性是估计值。官方明确表示,质量、摩擦系数这些更接近人看到一件物品时的直觉判断,属于「猜测的估计值」,暂时不能作为精密的工业测量结果,但足以支撑基础的物理仿真。
擅长刚体,柔性还不行。现阶段 WorldGen 主要擅长生成刚体,搭出一个能继续运行和修改的空间骨架。直接拧动水龙头、衣服自然褶皱这类关节化资产、柔性体和动态交互,还在技术路线图上。
透明与柔性材质仍是短板,复杂场景的成功率也还有提升空间。
定位很清楚。创始人兼 CEO 吴迪明确区分:WorldGen 不会改变公司定位,影眸仍然是一家 3D 生成公司,不是具身公司,也不是世界模型公司。
对普通人意味着什么
最直观的变化是:过去只能被观看的一张图片,现在可以变成能进入、能编辑、能交互的三维空间。
对做内容的人,多了一条新路径:先用 3D 把「世界里有什么、东西放在哪、镜头怎么走」固定下来,再让视频模型去补画面表现。现实里存在的空间可以扫描,不存在的空间(科幻场景、概念设计)可以由 WorldGen 直接生成——两者都能先形成可控的 3D 基底,再接入后续流程。
对小团队,它降低了验证成本:不必先配齐完整的美术工种,也能快速验证一个关卡或者一个世界设定。
而对整个行业来说,3D 生成的竞争焦点正在迁移——从「第一眼像不像」,走向「生成一个物体之后还能做什么」。
关注「AI 智习室」,每天一条看得懂的 AI 情报。