2026世界人工智能大会期间,昆仑万维“世界模型与多模态范式跃迁”专场论坛上,董事长兼CEO方汉宣布了一个明确的判断:2026年为“世界模型元年” 。

“过去两年AI行业的核心命题是‘生成’——生成文字、图像、视频、音乐。而从2026年开始,AI的核心命题将转向‘理解’与‘交互’——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。”方汉在演讲中表示。

支撑这一判断的,是昆仑万维在本次大会上集中发布的三款核心模型——Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,全面覆盖世界模型与AIGC创作两大前沿赛道。

一、Matrix-Game 3.5:Patch级记忆注入,单卡20FPS实时生成

作为本次发布的重头戏,Matrix-Game 3.5在技术层面实现了多项关键突破。

最核心的创新是Patch级别的记忆注入能力。传统视频生成模型在处理长时序内容时,往往面临“记忆遗忘”问题——生成几秒后就开始丢失前面的上下文。Matrix-Game 3.5将历史帧切分为带有3D坐标的Patch,推理时检索可见Patch并重新投影到当前视角,作为Memory Token注入DiT,实现长期一致性的空间记忆。简单说,模型在生成过程中能够携带并调用画面片段的记忆,从而把交互推向实时。

性能数据是这套技术最直观的验证:一个5B参数的模型,在720p分辨率下,单张显卡就能跑到20FPS的实时生成速度。同时具备1分钟记忆能力。

在数据层面,Matrix-Game 3.5构建了支撑下一代世界模型的无限数据生产体系,打造三条自动化数据生产管线,输出Video+Pose+Action+Language的高质量训练数据。截至目前已积累超500万高质量视频切片、超1万有效训练小时数、覆盖1200余个游戏场景。

二、从“生成”到“理解”:三大产业预判

基于Matrix-Game 3.5的技术突破,方汉在论坛上提出了三大产业预判:

第一,世界模型将走出屏幕,进入物理世界。 具身智能正从实验室走向真实环境,要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。谁能训练出在复杂场景中“看得懂、做得对”的模型,谁就拿到物理智能时代的入场券。

第二,游戏行业将率先被世界模型改变。 Matrix-Game 3.5让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,大幅降低开放世界游戏制作成本。

第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具。 Mureka作为中国最强、全球前两名的音乐生成模型,率先去除“AI味”,让普通人也能把模糊灵感转化为有情绪、有温度的作品。

三、开源路线:让世界模型成为全球开发者的公共基础设施

Matrix-Game从1.0到3.5始终坚持开源路线。3.5版本的核心架构已在GitHub开源。

这一策略的逻辑很清楚:世界模型要想成为下一代AI的基础设施,就不能被任何一家公司锁在围墙里。开源意味着全球开发者可以基于同一套技术底座进行创新,加速整个赛道的技术收敛和场景落地。

四、一个判断:国产模型已领跑全球

方汉在演讲中给出了一个明确的判断:国产世界模型已在这一赛道领跑全球。

这一判断的底气来自Matrix-Game 3.5的技术指标——5B参数、单卡720p、20FPS实时生成、1分钟记忆。在推理效率这个最考验工程能力的维度上,昆仑万维交出了一份全球领先的答卷。

从2022年确立“All in AGI与AIGC”战略,到2026年定义“世界模型元年”,昆仑万维完成了从全模态内容生成到可交互世界模型的关键跃迁。方汉表示,让AI从“会生成”走向“懂世界”、“能行动”,不只是一家公司的回答,更是中国AI从研发走向产业应用的一个缩影。

2026年,世界模型从概念走进了现实。而昆仑万维用Matrix-Game 3.5的20FPS,给这个元年写下了第一个可量化的注脚。