在计算机视觉领域,深度学习曾因在图像识别任务中的卓越表现而备受瞩目,然而当面对视频动作识别时,它却遭遇了前所未有的挑战。2012年,AlexNet在图像识别比赛中大放异彩,将传统手工特征方法远远甩在身后,深度学习由此成为计算机视觉的新宠。但当研究人员尝试将同样的深度学习方法应用于视频动作识别时,却发现效果不尽如人意。
当时,在UCF-101动作识别数据集上,表现最佳的深度学习模型准确率仅有65%左右,而一种名为“密集轨迹”的传统手工特征方法却能达到87%以上。这意味着,在识别100个动作视频时,深度学习会认错35个,而密集轨迹仅认错13个。深度学习每识别5个动作,就比传统方法多犯近1个错误,这一差距在当时的深度学习视觉任务中显得尤为尴尬。
问题出在哪里呢?图像识别只需判断照片中是否存在特定物体,而视频动作识别则要理解画面中人物正在进行的动作,这背后涉及时间维度上的变化。一张照片无法展现手是正在举起还是放下,要理解动作,就必须捕捉时间上的变化。然而,当时的深度学习网络大多是为处理静态图片设计的,并不擅长处理“变化”。
面对这一难题,牛津大学的Karen Simonyan和Andrew Zisserman展开了深入研究。他们认为,如果网络自身难以学好运动信息,不如直接将运动信息以明确的方式提供给它。那么,如何表示“运动”呢?他们选择了光流。
光流是一种描述视频中每个像素点在连续两帧之间运动方向和速度的表示方法,本质上是一张记录位移场的图像。在这张图像中,每个位置都有一个箭头,箭头方向代表像素点的移动方向,箭头长度代表移动速度。例如,将人走路的视频转换为光流图,腿部区域会有一串朝下又朝前的箭头,而静止的背景则几乎没有箭头。光流图不包含人物外貌等信息,仅专注于描述“什么在动、往哪动”。
这一设计的巧妙之处在于,它将网络不擅长的任务转换成了网络擅长的任务。网络不擅长从连续帧中领悟运动规律,但擅长处理图像。光流将运动信息重新打包成图像格式,使网络能够发挥其优势,从图像中抽取模式。
基于光流这一表示方式,他们提出了双流卷积网络模型。该模型由两条独立的卷积神经网络组成,一条是空间流,输入为视频中的单帧图像,负责识别画面中的场景、物体和人物外观;另一条是时间流,输入为光流图,负责捕捉运动模式。两条网络在结构上几乎镜像,均采用经典的卷积神经网络设计,包含若干层卷积和全连接层,最后各自输出动作类别的预测。训练时,两条网络分别进行训练,最后将预测结果融合,可采用简单取平均或使用支持向量机结合输出结果的方式。
为何要采用两条完全独立的网络,而非融合成一条呢?这是因为空间信息和运动信息的统计特性差异很大,风景照片和光流图性质截然不同。若强行用一套网络参数同时学习两种模式,效果可能相互干扰。分开训练,让每条网络专注于一项任务,最后融合结果,是更稳妥且易于训练成功的策略。
该研究还解决了训练数据不足的问题。当时,视频数据集规模远小于图像数据集,如UCF-101仅有1万多个视频片段,而ImageNet有上百万张图片。深度网络参数众多,需要大量数据喂养,否则容易过拟合。为此,研究人员让空间流网络先在庞大的ImageNet图片数据集上进行预训练,因为空间流本质是图像分类,图片数据集和视频帧中的视觉模式相通。网络先在图片数据中练好“认物体、认场景”的基本功,再迁移到视频帧上进行动作识别的微调。
理论需经实践检验。研究人员在UCF-101和HMDB-51两个标准数据集上进行了系统实验对比。实验结果显示,仅用空间流(单帧图像)准确率为72.6%,仅用时间流(光流)准确率为81.0%,而当时最强的手工特征方法密集轨迹准确率为87.9%。双流网络(空间流 + 时间流融合)准确率达到88.0%,首次在视频动作识别任务上正面击败了传统手工特征方法。
单独使用空间流准确率较低,说明仅靠画面内容难以准确识别动作;单独使用时间流准确率较高,证明运动信息对动作识别至关重要,且光流成功将运动信息转换为网络可理解的形式;两条流融合后准确率提升,表明运动信息和画面内容相辅相成,共同提升识别效果。
这篇论文发表后,双流架构成为后续视频动作识别研究的标准出发点。2016年,Feichtenhofer、Pinz和Zisserman提出改进方案,让两条流在网络中间层进行信息交互,使空间信息和运动信息更早相互影响,进一步提升识别准确率。2017年,DeepMind团队提出I3D网络,将二维卷积网络“膨胀”为三维卷积网络,可直接对视频片段进行三维卷积,同时提取空间和时间特征,且依然沿用双流思路,分别对RGB帧和光流做3D卷积再融合,在更大规模的Kinetics数据集上刷新了最好成绩。
双流网络成功的关键在于,它没有执着于让一个网络学会所有东西,而是承认了当时卷积网络在处理时间信息上的局限,采用传统算法计算光流,再将信息喂给网络。这种实用主义的做法,将复杂问题拆解为几个可控的子问题,分别解决后再拼合,取得了更好的效果。











