当你在观看一部两小时的电影时,能否全神贯注地捕捉每一句对白和每一个背景音,并立即回答关于剧情的问题?答案显然是否定的。人类大脑会自动筛选信息,抓住重点,忽略大部分重复或不重要的内容。如今,人工智能也面临着类似的挑战,尤其是在处理视频和音频数据时。这些数据被分割成大量的“token”(词元),即AI处理信息的最小单位,导致计算量急剧增加。这使得全模态大语言模型(Omni-LLM)在处理长视频时变得缓慢且昂贵,难以实际应用。
为了解决这一问题,研究者们开始探索如何在不损失理解能力的前提下,压缩这些冗余的token,以提高AI的运行效率。此前,已有一些团队尝试为Omni-LLM“瘦身”。例如,OmniZip方法利用音频信息指导视频token的压缩,而OmniSIFT则先对视频进行时空压缩,再用视觉信息筛选音频token。这些方法有一个共同点:它们都在进入大语言模型之前的预处理阶段就丢弃了部分token。然而,这种做法存在两个主要问题。
第一个问题是现有方法未能充分建模音视频的“长程时空结构”。在长视频中,关键情节线索可能分散在多个时间点,例如一次突然的画面切换或一声转瞬即逝的枪响。如果压缩算法仅关注局部重要性,容易遗漏这些散落在远处的关键信息。直接丢弃低分token会导致不可逆的信息损失,因为一些看似不起眼的token组合起来可能提供重要补充信息。
第二个问题涉及音频和视觉信息的协作时机。现有方法如OmniZip和OmniSIFT在预处理阶段就让一个模态指导另一个模态的压缩,但此时的音频和视频编码尚未进行深层语义互动,可靠性较低。尽管后续有OmniDrop和SEATS等方法尝试在大语言模型内部进行逐层压缩,但它们主要依赖文本查询指导压缩,未显式建模音频和视觉之间的协作关系。
针对这些问题,一项新研究提出了名为OmniPack的方法。这是一种无需额外训练模型参数的两阶段压缩框架,其核心思路是在进入大语言模型之前,先按各自模态的特点进行结构性压缩;进入模型并经过充分互动后,再根据任务需求进行语义级精细压缩。这一设计类似于团队协作:先由各部门各自清理冗余材料,再通过碰头会根据重点进一步精简。
在第一阶段,OmniPack分别独立处理视觉和音频token。这一阶段包括三个步骤:重要性筛选、覆盖度筛选和相似度感知的token合并。重要性筛选结合编码器注意力统计和结构变化信号(如视频的相邻帧变化和空间独特性,音频的相邻时刻声音变化)计算每个token的重要性分数。覆盖度筛选则通过结合特征相似度和位置距离,确保压缩结果覆盖整段视频或音频的不同区域。相似度感知的token合并将未被选中的token信息融合进与其最相似的代表token中,避免信息丢失。
在第二阶段,经过第一阶段压缩的视频和音频token与文本token一起进入大语言模型。经过若干层Transformer模块处理后,视觉和音频表示与文本进行了充分语义互动。此时,OmniPack启动查询条件化的模型内压缩,为每个token计算相关性分数,包括文本相关性、音视频协作程度和模态内代表性。采用兼顾相关性和多样性的贪心选择策略,确保选出的token覆盖不同类型的信息。
实验结果显示,OmniPack在多个基准测试集上表现优异。在Qwen2.5-Omni-7B模型上,保留25%预处理token和12.5%模型内token时,OmniPack保留了原始模型98.0%的性能,计算量仅为原来的16.7%。在极限压缩场景下,保留15%预处理和7.5%模型内token时,性能仍达95.6%,计算量减少10倍,推理速度提升4.5倍。即使压缩到10%预处理和5%模型内,性能仍保留92.9%,计算量仅6.8%。
消融实验进一步验证了OmniPack各组件的有效性。预处理阶段的三个组件(重要性筛选、覆盖度筛选、相似度合并)各自捕捉不同维度的信息,叠加使用效果更佳。模型内压缩阶段的音视频协作机制也显著提升了性能。文本感知引导方式在指导压缩时表现最优,说明充分利用用户提问的语义信息至关重要。
一个具体案例展示了压缩出错的影响。在一段视频中,问题询问“这是什么?”这句话最可能针对的场景。在25%预处理保留比例下,SEATS方法漏掉关键视频帧信息,选择了错误答案;而OmniPack因更好保留关键token,正确选出了答案。这表明,压缩需谨慎,一旦删错关键信息,模型回答方向会偏离。
目前,音视频token压缩方向仍处于早期阶段。OmniPack明确了预处理阶段和模型内阶段的不同任务分工,为后续研究提供了新思路。未来,这一领域可能向更细粒度的跨模态协作演进,通过更精细的跨模态对齐机制,进一步提升压缩性能。











