人工智能在视频内容理解领域取得新进展——一支由北京大学、快手Kling团队等顶尖机构组成的研究团队,提出了一种名为RefCaptioner的新型模型,能够精准地将视频描述中的每个词语与对应的参考图片关联起来,解决了长期困扰该领域的关键难题。
这项研究的核心挑战在于,当面对一段视频和一组参考图片时,AI需要完成三项复杂任务:首先识别哪些图片实际出现在视频中,哪些是无关干扰项;其次将每张有效图片准确绑定到描述中的对应词语;最后处理多张图片描述同一主体的情况,确保它们被归并到正确的位置。研究团队通过博物馆语音导览的类比形象地解释了这一难题:导览员需在带领参观时,即时指出展品与手中照片的对应关系,同时忽略无关图片,且不能混淆不同展品的描述。
为攻克这些挑战,研究团队设计了独特的两阶段训练方法。第一阶段采用混合数据监督微调,同时使用带图片标注的专门样本和普通视频描述样本进行训练,使模型既掌握图片绑定规则,又保持基础描述能力。第二阶段引入层次化覆盖折扣式强化学习(HCD-GRPO),通过多维奖励机制精细调整模型表现。该机制包含两个核心模块:事实描述奖励确保内容准确性,图片标签奖励优化图片使用质量,后者又细分为正确绑定覆盖率、干扰项感知抑制和跨图片语义一致性三个子机制。
研究团队构建了专门的评测基准MRVBench来验证模型效果。该基准包含462段测试视频,涵盖AI生成和真实拍摄内容,配套3831张参考图片,平均每段视频对应8张候选图片,最多达22张。测试结果显示,RefCaptioner在综合得分上达到0.888,在所有开源模型中位居首位,与商业系统Gemini-3.1-Pro的0.897分接近,且超越了参数规模更大的多个模型。在关键子指标上,RefCaptioner展现出全面优势:图片选取准确率达0.994,召回率0.943,图片与词语绑定准确率0.967,干扰图片排除率0.985,多图归组一致性指标Subj-R和Subj-F1分别达到0.817和0.869。
实验还揭示了传统"两步走"方案的局限性。当让现有模型先生成普通描述再插入图片标签时,虽然能在内容覆盖上取得一定优势,但在图片绑定准确率、多图归组一致性等关键指标上明显落后于RefCaptioner。这表明图片选取和词语绑定需要在描述生成过程中同步完成,而非后期修订。
值得注意的是,RefCaptioner在提升特定能力的同时,并未牺牲基础视频描述质量。在VDC和VCapsBench两个基准测试中,该模型在所有开源模型中均排名第一,特别是在背景、主要物体和详细描述等维度上相比基础模型有显著提升。这表明通过精细的图片绑定训练,模型反而增强了对视频细节的感知能力。
面对参考图片数量增加带来的挑战,RefCaptioner展现出强大的鲁棒性。当参考图片从2-4张增加到13张以上时,其综合得分仅从0.963下降至0.769,而其他模型如Qwen3.6-35B-A3B的得分则大幅下滑至0.398。在实际应用测试中,使用RefCaptioner描述驱动生成的视频,在人类评价者盲测中获得更高偏好,76%的评价者认为其重建效果优于Qwen3.6-35B-A3B。
消融实验进一步验证了设计决策的有效性。移除任何训练组件都会导致特定指标下降:去掉事实描述奖励会降低视频问答准确率,移除干扰抑制机制会显著影响干扰图片排除率,取消跨图片一致性机制则导致多图归组准确性下降。人类评价结果显示,RefCaptioner不仅在图片绑定准确率上接近商业顶尖系统,其描述的组织结构和表达方式更符合人类阅读习惯,因此获得最低的平均偏好排名。










