摘要:Runway 推出界面世界模型 Solaris,实时逐帧生成应用与网站界面并响应点击拖拽,绕过中间代码表示,可用于训练适应界面变化的智能体。

如果 Solaris 的演示能稳定复现,这是近期技术范式跨度最大的一条新闻之一。目前的"AI 生成界面"主流路线,是让模型吐出 HTML/CSS/React 代码,再交给浏览器渲染。Solaris 把中间这步直接删了——模型逐帧生成界面图像,你点击、输入、滚动,它据此生成下一帧。界面不是"被渲染"出来的,是被"想象"出来的。Runway 把这类模型叫做 Interface World Models(界面世界模型),Solaris 是这个系列的第一个。这个思路的源头其实是视频生成:世界模型在游戏和物理场景里已经被验证过——给定当前画面加一个操作指令,预测下一帧。Runway 本身就是视频生成起家,把这套能力迁移到"操作系统级界面"这个特定分布上,技术上是顺的。区别只在于,游戏世界模型预测的是画面,界面世界模型预测的是"你点了之后界面该变成什么样"。

它的价值不在"炫",而在两个很实在的场景。其一,研究和产品原型可以跳过前端实现,直接在一个会响应交互的界面上迭代想法,对设计师和非技术创业者尤其友好——你不用为了验证一个交互点子,先雇人把整套前端搭出来。其二,也是 Runway 自己强调的:这种模型可以用来训练智能体,让它们在"界面长什么样"会变化的世界里学会操作。因为真实软件天天在改版,死记硬背界面结构的 Agent 很容易失灵,而见过"界面是生成出来的"的 Agent,反而更鲁棒。这恰好和本期 #13 的 harness 工程形成有趣的对照:一个在重新思考"界面怎么产生",一个在重新思考"Agent 怎么被框住",两者共同指向一个趋势——智能体的运行环境正在被重新设计。

11.jpg

当然,要泼的冷水也很明确。逐帧生成的延迟、与现有 Web 技术的对接、以及"无代码中间层"如何做可访问性和 SEO,都是没被演示覆盖的硬问题。一个靠逐帧图像堆出来的界面,屏幕阅读器怎么读?搜索引擎怎么索引?表单状态怎么持久化?这些都是生产级前端绕不开的东西,而 Solaris 目前更像一个"界面即视频"的范式探针。它证明了"界面即生成"这条路能走,离替代常规前端开发还远。但对"交互的本质是什么"这个老问题,它给出了一个很有想象力的答案:也许界面不必是代码,而可以是一个被持续预测的世界。

抛开工程细节,Solaris 真正迷人的地方在于它重新定义了"界面"这件事。我们习惯认为界面是代码渲染出来的确定性产物,而 Runway 把它变成了一种"被持续预测的状态"——没有写死的 DOM,只有一帧接一帧的想象。这听起来离经叛道,却戳中了一个长期痛点:软件界面每天都在变,而绝大多数自动化方案都建立在"界面结构固定"的假设上,一旦改版就失效。界面世界模型如果成熟,恰恰能让智能体适应"会变的界面",而不是死记硬背。当然,今天它还远不能替代常规前端,可访问性、SEO、状态持久化这些"无聊但要命"的问题一个都没解决。但它像一面镜子,照出了"界面即生成"这个方向的可能性——值得研究者盯,但别指望它马上改变你的前端团队。