京东近日宣布,其自主研发的实时流式视频编辑模型JoyAI-Video-Edit正式开源。这一创新技术打破了传统视频创作模式,允许用户在观看视频的同时直接修改人物形象、场景元素或画面风格,将"先拍摄后编辑"的流程转变为实时互动创作。
该模型在流式视频编辑领域展现出显著优势。通过全自研的JoyAI-Video架构,模型在720P分辨率下可实现每秒30帧的实时处理能力,既能保证画面清晰度,又能匹配常见影视作品的播放速度。这一突破性进展解决了实时编辑中最核心的卡顿问题,为流畅的创作体验奠定基础。
与传统模型相比,JoyAI-Video-Edit突破了视频时长的限制。此前同类技术仅能处理几秒至数分钟的片段,而新模型支持任意时长的稳定流式编辑。用户无需等待完整视频生成,即可在播放过程中持续调整场景元素、替换物体或改变画面风格,真正实现"所见即所得"的创作方式。
在功能应用层面,该模型展现出强大的场景适应能力。创作者可以让视频中的人物连续变换服装造型,在直播场景中将现实街道实时转化为动画世界,甚至在家装设计中快速切换不同风格的家具组合与灯光效果。这种灵活性为内容创作开辟了新的可能性。
国际评测数据显示,JoyAI-Video-Edit在多项关键指标上领先同类技术。研究团队将其与SANA Streaming、LiveEdit等国际主流模型进行对比测试,结果显示新模型在典型编辑场景中的综合表现全面占优。特别是在OpenVE-Bench权威评测中,该模型在全局风格转换、局部元素替换、精准删除和字幕编辑等任务中展现出显著优势。
这项技术的影响力已超越视频创作领域。针对具身智能训练中数据采集成本高、危险场景难以复现等痛点,JoyAI-Video-Edit提供了创新解决方案。通过可控编辑能力,模型可将人类操作视频转化为机械臂训练素材,在保持物体空间关系和动作轨迹的前提下,自由替换场景、物体和机器人形态,从而低成本生成多样化训练数据。









