在计算机视觉领域,2014年曾存在一个普遍认知:深度学习在视频动作识别任务上难以超越手工设计的特征方法。当时,若要判断视频中的人物是在打网球还是拉小提琴,最先进的方法是“密集轨迹”——一种通过追踪像素点运动轨迹并结合周围信息描述动作的手工特征提取技术。该技术在权威的UCF-101数据集上能达到约88%的准确率,而同期深度学习方法的准确率普遍停留在65%至70%之间,差距显著。
深度学习在图像识别领域已展现强大实力,但在动作识别任务中却遭遇瓶颈。原因在于,动作识别的核心信息不仅存在于单帧画面中,更依赖于连续帧之间的动态变化。例如,仅凭一张照片,网络能识别出人物在挥动手臂,却无法判断这是挥手打招呼还是挥拍打网球。传统的卷积神经网络设计初衷是处理静态图像,要求其理解“运动”概念,无异于让一个只会翻看照片的人判断舞蹈的节奏与流畅度。
面对这一挑战,牛津大学视觉几何组的Karen Simonyan和Andrew Zisserman提出了一种创新架构——双流网络。该网络由两个独立分支构成:一个负责处理静态画面(空间流),输入为视频中的单帧图像,用于识别场景、物体和人物外观;另一个专门处理运动信息(时间流),输入为相邻帧计算出的光流场,用于捕捉动作的运动模式。最终,两个分支的判断结果被融合,形成对动作类别的综合判断。
光流场的引入是双流网络的关键创新。光流是一种描述像素点在连续两帧间移动方向和速度的向量场,通过将运动信息可视化成一张图,过滤掉了颜色、纹理等无关信息。论文中,时间流网络的输入并非单帧光流,而是连续10帧光流场的堆叠,以确保捕捉到足够长的运动轨迹,避免因瞬时位移相似而误判动作类型。
在数据融合方面,研究团队尝试了多种方式,包括直接平均两个分支的分类分数,或训练小型分类器学习组合规则。实验表明,使用支持向量机融合输出效果最佳。针对深度学习对数据量的高需求与动作识别领域数据稀缺的矛盾,团队采用多任务学习策略,同时利用UCF-101和HMDB-51两个数据集训练网络,共享底层参数,并通过裁剪、翻转、色彩抖动等数据增强手段扩充样本多样性。
最终,双流网络在UCF-101数据集上取得了88.0%的准确率,首次追平并略微超越了密集轨迹方法。进一步分析显示,单独使用空间流的准确率为72.6%,单独使用时间流则达到81.0%,表明运动信息对动作识别的贡献远大于静态画面信息。而两条流的融合又带来了至少7个百分点的提升,证明空间与时间信息具有互补性。
双流网络的提出为视频动作识别研究开辟了新方向。2016年,Feichtenhofer等人通过研究不同层级的融合方式,发现让空间流与时间流在中间卷积层开始交互(时空融合),能进一步提升性能。同年,Wang等人提出的时序分段网络通过将视频切分为多个片段并综合判断,解决了原始双流网络难以捕捉长时间动作模式的问题,将UCF-101上的准确率推至94%以上。
尽管双流网络取得了突破,但其对光流的依赖仍被视为一个局限。后续研究中,三维卷积网络等模型尝试直接从原始视频帧中学习运动信息,摒弃显式光流计算,但这一转变往往需要更多的数据和算力支持。双流网络的成功与局限共同揭示了一个深刻问题:在模型设计中,如何更有效地呈现数据中的关键信号,往往比单纯追求模型复杂度更为重要。











