京东近日宣布,正式开源其自主研发的实时流式视频编辑模型——JoyAI-Video-Edit。这一创新技术突破了传统视频编辑的局限,允许用户在观看视频的同时,实时修改人物形象、场景布局或画面风格,将视频创作从“先拍摄后编辑”的模式转变为“边观看边创作”的互动体验。
在实时视频编辑领域,处理速度是核心挑战。视频由连续帧组成,若模型推理速度无法匹配播放节奏,便会导致卡顿或延迟。JoyAI-Video-Edit基于全自研的JoyAI-Video模型架构,在720P分辨率下实现了每秒30帧的流畅处理能力,既能保持画面清晰度,又能无缝跟随常见影视视频的播放速度,为实时互动编辑提供了技术保障。
该模型另一突破在于支持任意时长的流式编辑。此前同类模型仅能处理短至数秒、长至数分钟的片段,而JoyAI-Video-Edit可随视频持续播放同步处理,用户无需等待完整视频生成,即可在播放过程中动态调整场景、替换物体或改变画面风格。例如,创作者可让人物在视频中连续更换服装,或在直播中将现实街道实时转化为动画场景,甚至在家装设计中模拟不同家具、墙面和灯光的组合效果。
为验证模型性能,研究团队将其与SANA Streaming、LiveEdit、Xmax-X2.0等国际主流流式视频编辑模型进行对比。在覆盖典型编辑场景的评测数据中,JoyAI-Video-Edit在画面质量、编辑灵活性和响应速度等指标上均表现优异。在OpenVE-Bench通用评测中,该模型更以显著优势超越现有方法,尤其在全局风格迁移、局部物体替换与删除、字幕编辑等任务中展现出突出能力。
除视频创作领域外,JoyAI-Video-Edit还为具身智能训练提供了低成本数据合成方案。机器人训练依赖大量物体操作视频,但真机数据采集成本高昂,且危险或罕见场景难以重复获取。该模型通过可控编辑能力,可将人类操作视频转化为机械臂训练素材,在保留物体位置、空间关系和动作轨迹的同时,替换场景、物体或机器人形态,从而将单一视频扩展为多样化训练样本,大幅降低数据获取门槛。
目前,JoyAI-Video-Edit已通过开源平台向全球开发者开放,其代码与模型权重均可自由获取,旨在推动实时视频编辑技术的普及与创新应用。











