摘要:Runway 推出界面世界模型 Solaris,逐帧实时生成应用与网站界面,跳过中间代码表示,以图像本身作为交互层,可用于训练适应界面变化的智能体。
如果 Solaris 的演示能稳定复现,这是今天这批新闻里技术范式跨度最大的一条。
先说清它在做什么。目前的“AI 生成界面”主流路线是:模型输出 HTML/CSS/React 代码,浏览器渲染成界面。Solaris 把中间这一步删了——模型直接逐帧生成界面图像,用户点击、输入、滚动,模型据此生成下一帧。界面不是被渲染出来的,是被“想象”出来的。Runway 把这类模型叫做 Interface World Models(界面世界模型),Solaris 是这个系列的第一个。
这条路线的直觉来源其实是视频生成。世界模型在游戏与物理场景里已经验证过:给定当前画面与操作指令,预测下一帧。Runway 本身就是视频生成起家,把这套能力迁移到“操作系统级界面”这个特定分布上,技术上是顺的。
值得琢磨的是它的两个应用方向。

开放式交互是更吸引眼球的那个。传统界面的可交互元素是有限枚举的,代码里写了什么就只能点什么。图像生成式界面理论上没有这个约束——你可以在任何位置做任何操作,模型来决定该有什么响应。这打开了一些原本做不了的产品形态,比如概念探索阶段的界面演化、或者根据用户行为实时重组的自适应界面。
训练智能体是更务实的那个,我个人觉得价值更大。当前 GUI 智能体最大的脆弱点是过拟合:在固定截图集上训出来的模型,一旦界面改版、按钮挪位、弹窗样式变了,成功率就崩。Solaris 可以充当界面变化的生成器,给智能体制造无穷多的布局扰动做数据增强。这个用法很可能比“用它做产品界面”更早产生实际价值。
限制也很明显。逐帧生成的算力开销远高于渲染 DOM;文字保真度是图像生成模型的老问题,界面里一个数字错了就是业务事故;状态一致性——用户填了表单翻页再回来,数据还在不在——在纯生成范式下是硬难点。所以短期内它不会替代任何生产环境的前端。
但方向本身足够有意思。它在追问一个基础问题:界面到底需不需要代码这个中间层?
再补一层产业层面的观察。Runway 这两年的路径其实很连贯:从视频生成起步,积累了帧间一致性和条件控制的能力,然后把这套能力往“可交互”的方向推。世界模型这个概念在游戏和机器人领域已经热了一段时间,但那些场景的评价标准是物理合理性——球该往哪滚、门该怎么开。界面场景的评价标准完全不同,它要求的是符号精确性:文字不能错、数字不能变、状态不能丢。这是一个比物理模拟更苛刻的分布。
所以 Solaris 真正的技术难度可能不在生成质量,而在一致性约束。视频生成里画面轻微漂移无所谓,观众看不出来;界面里一个像素级的错字就是 bug。如果 Runway 找到了在生成过程中施加强符号约束的办法,那这套方法论的适用面会远超界面本身。
对国内团队的启示是方向性的:GUI 智能体的数据瓶颈是真实存在的问题,靠人工采集界面截图和操作轨迹成本极高且覆盖不全。用生成模型合成界面变化来做数据增强,这条路技术门槛不算高,收益却很直接。哪怕不做 Solaris 那样的完整世界模型,只做“界面布局扰动生成器”这一个窄工具,对训练鲁棒的 GUI 智能体也很有帮助。




