在视频创作领域,一项突破性技术正引发变革。京东近日宣布开源其自主研发的实时流式视频编辑模型JoyAI-Video-Edit,该模型通过创新技术架构,将传统视频编辑的"素材预处理-批量修改"模式升级为"边播放边创作"的实时交互模式,为影视制作、电商直播、家装设计等行业带来全新解决方案。
传统流式视频编辑长期面临两大技术瓶颈:一是处理速度难以匹配实时播放需求,二是无法支持长视频的稳定编辑。JoyAI-Video-Edit基于全自研的JoyAI-Video模型架构,在720P分辨率下实现每秒30帧的实时处理能力,确保画面清晰度与播放流畅性同步达成。更突破性的是,该模型突破了时长限制,支持任意时长视频的持续编辑,用户可在播放过程中动态调整场景元素、替换物体或修改人物形象,实现真正的"所见即所得"创作体验。
技术团队通过对比实验验证模型性能。在涵盖全局风格转换、局部物体替换、特定元素删除等核心编辑任务的OpenVE-Bench评测中,JoyAI-Video-Edit各项指标均超越SANA Streaming、LiveEdit等国际主流模型。特别是在需要精准理解编辑意图的复杂场景中,该模型展现出显著优势,既能保持实时处理特性,又能确保画面细节的准确还原。
这项技术已展现出广泛的应用潜力。在电商直播场景中,主播可实时切换服装款式或展示背景,观众点击屏幕即可触发商品模型替换;家装设计师通过模型能即时呈现不同家具组合效果,客户可直观比较多种装修方案;影视创作者则可快速验证不同造型设计或场景布置的视觉效果,大幅减少重复拍摄成本。更值得关注的是,该模型为具身智能训练提供了创新路径——通过编辑真实操作视频生成机器人训练数据,有效解决了高危场景数据采集难题。
作为京东物理世界模型矩阵的重要组件,JoyAI-Video-Edit与现有图像编辑、语音交互、机器人操控等模型形成技术协同。这个包含JoyAI-Image-Edit(空间编辑)、JoyAI-Echo(长音视频生成)、JoyAI-VL-Interaction(实时观察回应)等模块的体系,构建起覆盖多模态交互的基础模型网络。此次开源不仅完善了模型矩阵布局,更通过开放核心能力推动行业技术进步,为AI在物理世界的深度应用奠定技术基础。













