北京时间9月1日05:16(对应官方发布时间 2026年8月31日21:16 UTC),Runway 正式发布首个界面世界模型 Solaris,将软件与网页界面从预先编码的固定页面转变为随用户操作实时逐帧生成的交互体验。该发布于当日经由 Runway 官网新闻与国内专业媒体同步呈现,属于上海当日窗口内的实质新发布;目前状态为研究预览下的早期体验,非全面开放。
核心能力与交互方式
Solaris 不再依赖将视觉设计翻译为代码再渲染的传统路径,而是以单一世界模型直接生成每一帧,并将用户输入视为下一帧的条件。用户可对虚拟服装店中的衣物直接拖拽试穿、通过语音指令如“移动桌子看看效果”或“改变沙发颜色”实时改变场景,光影与材质随操作连续演化,界面在交互中保持即时、可演进的状态。
技术基础与实时化改造
- 1)基础模型:基于 Runway Gen-4.5 视频生成模型与通用世界模型 GWM-1,新增对交互的理解能力;2)自回归生成:每帧仅依赖已发生交互,避免未来信息泄露以学习动作与视觉结果关系;3)加速蒸馏:将数十步去噪精炼为数步,并通过在自身输出上持续训练维持长会话稳定性;4)推理与渲染分离:由大语言模型解释意图并决定场景演进,再由世界模型负责视觉渲染与连续生成。
访问与可用条件
Solaris 当前通过 https://runway.com/news/research/introducing-solaris 公布并开放早期体验申请,面向首批关键合作伙伴,需在官网提交申请并经审核后开通,未公布统一自助注册入口、价格与配额。未提及对中国大陆的专门限制,但普通用户与中国开发者目前需以申请方式排队体验,实际开通以官方回复为准。运行形态为基于云端的实时生成服务,未公布本地部署或独立客户端,访问依赖网络与浏览器环境。
与传统路径的差异
以往界面依赖代码中间表示,视觉丰富度在翻译中被有损压缩,且行为需预先逐一定制;多模态大语言模型基于截图重建界面时,随视觉复杂度上升重建质量显著下降。Solaris 则直接在视觉层操作,省去翻译环节,首帧即可保留完整视觉与语义状态,并通过世界模型保持跨帧一致性,相比代码式更新在自然度与上下文连贯性上更接近物理场景。
限制、风险与下一步
- 1)文本:界面文字的实时稳定生成仍是视频生成领域的难点,复杂文字界面可能出现模糊或闪烁,建议对文字密集场景采用图文混合方案;2)可信度:面向教学或商业场景时,需以起始帧提供的真实产品图像与参考资料锚定内容,避免生成不实信息;3)长会话:长时间开放式交互的视觉与语义一致性仍在优化中;4)无障碍:与屏幕阅读器等辅助技术的集成尚未完善。对中国产品与设计团队而言,可先以品牌或产品场景起始图申请早期体验,验证拖拽、语音驱动的交互范式及与现有前端工作流的衔接,再评估后续接入节奏。