8月3日,商汤科技宣布开源轻量级统一多模态模型SenseNova U1.5-Lite-Preview的预览版本。这是继今年4月SenseNova U1发布后,商汤在原生统一多模态路线上的又一次关键迭代。

8B-MoT的体量,商用闭源的水平

SenseNova U1.5-Lite-Preview最值得关注的地方,在于它的“轻”与“强”同时成立。

模型基于商汤自研的NEO-unify架构,在仅8B-MoT的规模下,实现了原生4K图像生成。官方表示,该模型在多项主流生成与编辑质量评测基准上显著超越前代U1,以轻量级规模实现了可比肩商用闭源模型的图像生成能力与编辑效果。

8B参数跑出商用闭源级效果,意味着开发者不需要几十亿的算力预算,也能调用接近顶尖水平的图像生成能力。

四大升级,瞄准真实创作场景

相比U1,U1.5-Lite-Preview在四个方向上带来了显著提升:

原生4K图像生成。无需外部超分模块,模型直接输出4K分辨率图像,细节保留更完整。对需要高清输出的设计、广告、游戏素材等场景,这是一次质的跨越。

更精细的局部纹理与真实质感。从皮肤毛孔到织物纤维,从金属反光到水面倒影,模型在微观细节层面的表现力明显增强,生成的图像更接近真实世界的物理质感。

更准确的中英文文字生成与复杂版式组织。海报、说明书、信息图等需要嵌入文字的场景,一直是多模态模型的短板。U1.5-Lite-Preview在这方面做了针对性强化,中英文混排、多字体、复杂版式的还原度都有明显提升。

更稳定的图像编辑和视觉指令遵循。这不是一个“一次出图”的模型,而是一个支持持续迭代的创作工具。新模型支持参考图风格迁移、多参考图组合编辑以及交互式精准调整,让AI图像创作从“一次性抽卡”转向可持续迭代优化。

从“能不能做”到“能不能持续做”

如果说U1验证了“统一架构是否可行”——证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线,那么U1.5则进一步验证了“能力能否持续扩展”。

这种迭代逻辑,恰恰回应了当前多模态模型竞争的核心命题:参数规模的竞赛正在让位于效率、控制能力和实际应用体验的比拼。一个8B的模型能做4K生成、能做精准的文字渲染、能支持多轮编辑迭代——这说明多模态AI的能力下沉正在加速。

目前SenseNova U1.5-Lite-Preview已在GitHub、Hugging Face及魔搭社区同步开源。同时,面向专业创作者和企业用户的交付级创作模型SenseNova U1 Pro正处于紧密邀测阶段。

当8B的模型开始输出4K图像,多模态AI的普惠化才真正有了落地的抓手。商汤这一步,把门槛又拉低了一截。