现在的网页和 App,基本都遵循同一套逻辑:设计师画出界面,工程师把它翻译成代码,用户再按照开发者预先设计好的按钮、菜单和流程操作。8 月 31 日,Runway 公布了一个大胆的方向:如果界面不再由固定代码提前写死,而是由 AI 根据你的动作实时生成,会发生什么?
这个名为 Solaris 的系统,被 Runway 称为 Interface World Model,也就是「界面世界模型」。它不是只生成一张网页截图,也不是把设计稿转换成 HTML,而是尝试让整个视觉界面在用户点击、拖拽和输入时持续变化。简单说:过去的软件是「先写好,再使用」;Solaris 想探索的是「边使用,边生成」。
「界面世界模型」到底是个什么东西
理解 Solaris,先要区分三种东西:图片、代码界面和界面世界模型。一张图片可以很好地呈现视觉效果,但它不能真正响应点击;一套代码界面可以响应点击,却需要开发者提前写好每一种行为;而界面世界模型试图直接学习「画面、用户动作和下一步变化」之间的关系。
可以把它看成一个会动的数字场景:用户点击、拖动或输入,模型理解这次动作和当前场景,生成下一帧画面与对应变化,用户继续操作,场景持续演化。传统 App 更像一张有固定路线的地铁图,用户只能沿着设计好的站点前进;Solaris 更像一个可以随时改造的房间,你说「把桌子移开一点」或「把沙发换成蓝色」,界面会直接在当前场景中做出反应。
Runway 用三个词概括 Solaris 的界面特征:完全视觉化(图像本身就是应用,比如在虚拟服装店里把衣服直接拖到自己照片上试穿)、持续变化(界面自己会动,反射随光线变化,物体被操作时自然响应)、开放式交互(行为不预先写死,同一起始画面可能因为不同表达产生完全不同的行为)。
它是怎么工作的:推理与渲染分工
Solaris 建立在 Runway 的 Gen-4.5 视频生成模型之上,延续了 GWM-1 通用世界模型的技术路径。它的核心是「推理 + 渲染」分工:一个语言模型负责理解用户意图,判断当前场景应该如何变化,并生成引导提示;界面世界模型负责把这个变化渲染成下一帧画面。可以理解成导演和摄影师——语言模型决定下一场戏演什么,Solaris 负责把它即时拍出来。
从模型视角看,点击、拖动、输入都不再是某段预设代码的触发器,而是下一帧生成的条件。为了达到实时响应,Runway 做了三步优化:先让模型以自回归方式逐帧生成,每一帧依赖此前状态;再把多步去噪蒸馏为少数步骤;最后让快速模型继续在自身输出上训练,维持较长交互过程的稳定性。目标是在交互速度下保持 720p 视觉质量,官方称运行成本比标准视频扩散模型便宜数个数量级。
测试数据:比代码生成的界面更讨人喜欢
Runway 公布了用户研究数据:250 名参与者、30 个交互示例、近 7500 次成对判断,对比对象是由 Claude Opus 5 从同一张起始图、同一交互请求生成的代码界面。结果显示,参与者认为 Solaris「更符合交互指令」的比例是 61% 对 24%,认为「行为更自然」的比例是 71% 对 21%,其余判断为不相上下。
需要冷静看待的是,这项研究由 Runway 自行设计和发布,更适合作为其能力展示,而不是独立第三方评测。它确实指出了一个方向——代码界面擅长确定性的局部更新,世界模型则试图让物体、材质和环境的变化显得更连贯。
官方承认的五大局限,反而更值得读
Runway 自己也明确列出了几项关键难题。第一是文字:稳定、清晰、长期一致的文字依然是视频生成的难题,而传统界面恰恰高度依赖文字,所以更现实的方案可能是图像模型负责文字主视图、视频模型处理连续交互的混合系统。第二是事实可信度:在教学或商业场景里,一个看起来真实却错误的答案可能比没有答案更糟,模型需要持续锚定在经过验证的产品数据、文档和参考材料上。第三是长会话一致性:连续运行几十分钟后,场景、物体身份、布局与语义能否维持稳定,仍是开放问题。第四是无障碍与系统集成:传统网页拥有 DOM、ARIA、屏幕阅读器、Accessibility API 等完整基础设施,生成式界面必须与这些系统结合。第五是成本:Solaris 在使用过程中持续推理与生成,虽然已比标准视频扩散模型便宜多个数量级,但相比「构建一次服务大量用户」的传统网页仍是变量。
短期别指望它替代 React,但方向值得所有人看懂
Solaris 目前仍是研究预览,官方开放了早期访问申请,未公布定价、API 和硬件要求。短期更可能出现的不是「React 消失」,而是传统软件、LLM Agent、生成式 UI 与世界模型的组合:文本密集、需要精确数据和强可访问性的部分仍由传统界面承担;连续操作、空间感强、需要沉浸式表达的部分才适合逐帧生成。
Solaris 真正提出的问题,不是「AI 能不能生成一个更漂亮的网页」,而是:软件是否一定要先被完整写好,用户才能开始使用?如果界面可以根据意图实时生成,未来的操作系统、网站和应用,可能会越来越像可交互的数字环境。对于设计师、前端和所有靠「界面」吃饭的人来说,这条技术路线的每一步进展,都值得保持关注。
关注「AI 智习室」,每天一条看得懂的 AI 情报。