8月5日,京东宣布正式开源自研的实时流式视频编辑模型 JoyAI-Video-Edit,在业界权威的 OpenVE-Bench 通用评测中全面领先。该模型基于全自研 JoyAI-Video 底座打造,在720P分辨率下实现了每秒30帧的稳定推理速度,画面处理无明显延迟卡顿,能够匹配常见影视视频的播放节奏。

一、技术突破:把视频编辑从“离线渲染”变成“实时对话”

传统视频编辑遵循“拍摄-剪辑-渲染-输出”的线性流程,一次修改往往意味着数小时甚至数天的等待。京东 JoyAI-Video-Edit 的核心突破在于将这一流程从离线渲染变成了实时互动。

首先是速度问题。 视频由一帧帧连续画面组成,如果模型处理速度跟不上播放速度,就会出现卡顿与延迟。JoyAI-Video-Edit 在720P分辨率下实现每秒30帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。

其次是时长问题。 此前的流式编辑模型大多只能处理几秒或分钟级片段。JoyAI-Video-Edit 支持任意时长的稳定流式编辑,用户不必等待整段视频生成完成,就能在播放过程中持续调整。

在编辑能力上,模型支持实时更换人物着装、实体物件、整体场景与画面艺术风格。创作者可以让视频中的人物连续更换服装,在直播中把普通街道变成动画世界,也可以在家装设计中尝试不同的家具、墙面和灯光效果。

二、性能表现:OpenVE-Bench全面登顶,四类任务优势突出

研究团队将 JoyAI-Video-Edit 与 SANA Streaming、LiveEdit、Xmax-X2.0 等国际代表性流式视频编辑模型进行了系统对比。

在业界权威的 OpenVE-Bench 通用评测中,该模型超越了目前所有的流式编辑方法。在全局风格、局部替换、局部删除和字幕编辑四类任务中优势尤其突出,大幅领先行业同类模型。

京东官方表示,在流式实时视频编辑方向,JoyAI-Video-Edit 对比当前业内代表性模型各项指标全面领先,达到世界一流水平。实时出图画质可对标离线专业剪辑模型。

三、应用场景:从电商直播到机器人训练的多维覆盖

JoyAI-Video-Edit 的商用场景相当广泛。电商直播中可实时切换展示商品与模特穿搭;家装设计中可快速替换家具样式与整体装修风格;影视前期拍摄中可即时调整场景与人物造型,有效降低实景重拍带来的资金与时间成本。

更值得关注的是其在具身智能数据合成领域的价值。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。JoyAI-Video-Edit 可将人手操作视频转化为机械手或机械臂操作素材,在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本。

四、开源生态:补齐JoyAI全系列实时视频编辑能力

此次开源补齐了 JoyAI 全系列模型的实时视频编辑能力。搭配 JoyAI-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction 等模型,完整覆盖图像创作、长音视频处理、实时交互、语音合成、机器人动作控制全链路 AI 能力。

目前,JoyAI-Video-Edit 模型已在 Hugging Face 和 GitHub 两大平台开源,开发者与内容创作者可获取模型自主部署调试或进行功能二次开发。