ITBear旗下自媒体矩阵:

京东开源160亿参数流式视频编辑模型,实时视频编辑新范式来了

   时间:2026-08-07 14:20:47 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

AI视频领域正经历一场技术革新,字节跳动与MiniMax等企业近期相继推出新模型,将视频生成时长与成本推向新高度。然而,一个长期被忽视的痛点始终存在:用户需等待视频完整生成后才能评估效果,修改则需重新排队处理。这种"离线式"交互模式,正在被语音赛道率先突破——OpenAI的GPT-Live已实现全双工实时对话,让语音交互告别"你说一句、我回一句"的传统模式。

京东近日开源的JoyAI-Video-Edit模型,将这种实时交互范式引入视频编辑领域。作为首个实现"流式架构+实时速度+可用质量"的开源模型,其在720P分辨率下达到30帧/秒的推理速度,系统端到端稳定输出24帧/秒,支持无限时长的连续编辑。这意味着用户可像操作实时滤镜般调整视频内容:将人物变为乐高形象、切换卧室装修风格,甚至实时替换服装配色,所有修改均能即时呈现。

该模型的技术突破体现在两方面。在速度优化上,研发团队采用SA-DMD训练方法,将传统扩散模型所需的十余步迭代压缩至两步,配合160亿参数的多模态Transformer架构,在单张Nvidia B200 GPU上实现226毫秒的端到端延迟。相较于其他流式编辑模型为追求速度而压缩至1.3亿参数的做法,JoyAI-Video-Edit在保持720P高清输出的同时,速度提升1.4至2倍。

针对长视频编辑的稳定性难题,研究团队提出"有界KV状态推理"机制。通过限制模型记忆范围至最近帧与首帧,既控制了计算资源消耗,又通过专项训练确保画面连贯性。测试数据显示,该模型在连续编辑1小时视频时,仍能保持风格统一与物体形态稳定,彻底解决了传统自回归模型"越改越飘"的技术瓶颈。

在权威基准测试OpenVE-Bench中,该模型以3.60分领跑流式编辑赛道,在局部删除等任务中超越所有离线商业模型。长视频专项测试LongV2VBench显示,其3.30分的综合评分较次优模型高出1.59分,30.19帧/秒的处理速度达到行业领先水平的两倍。人类评估盲测中,该模型在四组对比中均获得超80%偏好率,与顶级离线模型Bernini-R的对比中也以48%对44%微弱领先。

这项技术正在重塑内容生产流程。传统视频制作中"修改-渲染-预览"的循环被打破,创作者可实时调整色调、风格与元素,将后期制作转化为现场创作。电商直播场景中,同一视频流可根据观众偏好实时生成不同服装搭配;影视预演阶段,导演能即时调整场景元素观察效果,将共识形成成本降低60%以上。

京东的技术布局远不止于内容创作。在具身智能领域,该模型可一键将人类操作视频转换为机器人训练数据,完整保留物体位置与动作轨迹。这与京东已有的JoyAI模型矩阵形成协同效应:VL-Interaction模型实现环境感知,Talker模型完成语音交互,RA模型驱动机械臂操作,Video-Edit则负责批量生成训练素材。这套覆盖"感知-决策-执行-学习"全链条的技术体系,正支撑着京东构建全球最大物理世界运营中心的战略目标。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version