ITBear旗下自媒体矩阵:

京东开源160亿参数模型:实时视频编辑新突破,流式赛道断层领先

   时间:2026-08-07 23:22:14 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

AI视频领域正迎来一场技术革新,京东近日开源的JoyAI-Video-Edit模型成为焦点。这款模型首次实现了"流式架构+实时速度+可用质量"的突破,在视频编辑赛道开辟了新路径。与传统离线模型不同,它能够直接处理实时视频流,支持直播、视频通话等动态场景的即时编辑。

该模型在720P分辨率下达到每秒30帧的推理速度,系统端到端稳定运行在24FPS,支持无限时长的连续编辑。用户通过自然语言指令即可实现实时视觉特效,例如将人物变老、切换场景风格或替换物体形态。在电商直播场景中,主播可动态更换服装配色、调整背景布置,系统能根据不同观众需求生成个性化画面版本。

技术实现层面,研发团队构建了包含MLLM条件编码器、因果视频VAE和160亿参数多模态扩散Transformer的架构体系。通过SA-DMD训练方法将单帧处理步骤从十余次压缩至两次,在Nvidia B200 GPU上实现226毫秒的端到端延迟。区别于其他流式模型通过缩小参数规模提升速度的做法,该模型在保持160亿参数规模的同时,将分辨率提升至720P,处理速度较同类产品提升1.4至2倍。

针对长视频编辑常见的画面漂移问题,团队提出"有界KV状态推理"机制。该技术通过限制模型记忆容量,仅保留最近处理片段和首帧作为参考,使计算资源消耗与视频时长解耦。配合专门设计的长视频训练策略,模型在连续处理数小时视频时仍能保持画面稳定性,解决了自回归模型误差累积导致的画面崩坏难题。

在OpenVE-Bench通用基准测试中,该模型以3.60分领先所有流式编辑模型,在局部删除等子任务中超越商业离线模型。LongV2VBench长视频专项测试显示,其总分较第二名提升1.59分,处理速度达到30.19FPS。人类评估盲测中,面对四个流式竞品模型,该模型获得最高90%的偏好率,与顶级离线模型Bernini-R的对比中也取得微弱优势。

这项技术正在重塑内容生产流程。传统视频制作中反复渲染的等待环节被消除,创作者可实时调整参数并立即看到效果。在电商领域,单次拍摄即可生成多版本商品展示视频,系统根据用户画像动态切换画面元素。更深远的影响在于,该模型在摄像头与显示屏幕之间构建了可编程语义层,使视频编辑能够理解画面内容并保持跨帧一致性。

京东的技术布局已延伸至具身智能领域。针对机器人训练数据稀缺的痛点,该模型可快速将人类操作视频转换为机械臂训练素材,完整保留物体空间关系和动作轨迹。这与京东正在构建的JoyAI模型矩阵形成协同效应,涵盖视觉交互、语音对话、机器人操控等多个维度,为其物流仓储、直播电商等业务场景提供技术支撑。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version