自动驾驶汽车在城市道路上行驶时,面对常规场景已能应对自如,识别红绿灯、礼让行人、平稳换道都不在话下。然而,当遇到迷路的奶牛、挥手指挥交通的警察,或是被橙色锥桶临时改道的施工路段时,汽车的“AI大脑”往往会陷入困惑。这些在训练数据中极少出现的罕见场景,构成了自动驾驶领域的“长尾问题”,成为制约技术进一步发展的关键瓶颈。
所谓“长尾问题”,是指将所有驾驶场景按出现频率排序后,常见场景构成“大头”,而各种罕见却危险的意外情况则形成一条漫长的“尾巴”。尽管这些情况出现的概率较低,但每一种都可能让训练有素的AI司机犯下致命错误。研究团队将这些罕见但关键的场景称为“长尾事件”,解决这一问题的核心在于获取足够多且多样的此类数据来训练AI。
现实中,记录罕见场景的视频并不稀缺,网上有大量行车记录仪视频,Waymo等公司也积累了丰富的真实路况数据。然而,这些视频大多仅有一个摄像头拍摄的单一视角,如同人类只用一只眼睛看世界,难以准确判断深度和方向。现代自动驾驶汽车依赖车身周围360度布置的多个摄像头,需要从不同方向同时观察才能做出准确判断。单摄像头视频与多摄像头视频之间的差距,使得大量珍贵的真实长尾场景数据无法直接用于训练。
为解决这一难题,由多所顶尖机构联合组成的研究团队开发了名为OpenLongTail的开源生成式数据引擎。该引擎能够将普通的单摄像头行车记录仪视频转化为完整的多摄像头同步视频资产,就像为只有前视摄像头的汽车“安装”上左、右、后方的摄像头,并生成视觉上相互吻合、时间上完全同步的画面。这些“扩充”后的数据用于训练AI驾驶系统,取得了显著效果。
要将单摄像头视频转化为多摄像头视频,首先需要解决车辆运动轨迹的确定问题。专业采集的自动驾驶数据通常携带精确的GPS和惯性导航信息,但野外采集的行车记录仪视频往往缺乏这些数据。研究团队选用MapAnything基础模型,通过分析连续帧之间的画面变化,推断摄像头在三维空间中的移动方式,从而给出每一帧对应的摄像头位置和朝向,即“位姿”。为得到平滑稳定的轨迹,团队在MapAnything的输出上叠加了“先向前、再向后”的平滑处理,使用卡尔曼滤波和Rauch-Tung-Striebel平滑器,确保轨迹既有精准的物理尺度,又足够平稳。
有了稳定的运动轨迹后,下一步是生成其他方向的摄像头画面。研究团队以Wan 2.1-VACE视频扩散模型为骨架,为其装配了三个“法宝”来处理关键问题。第一个法宝是“Plücker射线几何编码”,它将每个摄像头的每个像素用六个数字描述其在空间中的方向和位置,并注入到扩散模型中,让模型清楚知道生成每个像素对应的视角方向,确保所有计算在统一的三维坐标系下进行。第二个法宝是“时序深度变换”,通过DepthCrafter深度估计模型推算前视画面中每个像素的距离,将前视画面中的像素“搬到”三维空间中,再从目标摄像头的角度重新投影,得到几何对齐的参考画面。对于后方摄像头,利用车辆向前行驶的特点,设置特定时间偏移量,从若干帧前的前视画面出发做变换,覆盖当前时刻后方摄像头应看到的区域。第三个法宝是“跨视角记忆库”,按照严格的拓扑顺序依次生成五个非前视摄像头画面,每个视角生成完毕后,其特征存入记忆库供后续参考。记忆库维护“密集记忆”和“语义记忆”两种类型,在扩散模型的去噪过程中动态注入,确保所有生成的摄像头画面在视觉上浑然一体。
评测从四个维度进行。在视角合成质量评测中,OpenLongTail在所有五个目标视角上均优于竞争方法,以前左视角为例,其PSNR达到13.28,LPIPS为0.597。在跨视角几何一致性得分(GeoKPM)上,OpenLongTail高达82.41,远超竞争方法。轨迹恢复质量评测中,OpenLongTail在保持与MapAnything相同绝对轨迹精度的同时,将轨迹的加加速度和加速度方差降幅超过90%,轨迹极为平稳。在闭环驾驶仿真测试中,用真实多摄像头长尾数据训练的AI综合得分为0.764,碰撞率0%;用OpenLongTail合成数据训练的AI得分为0.748,碰撞率同样为0%,证明合成数据是真实数据的有效替代品。定性分析显示,在施工路段场景中,使用合成数据训练后的AI能够识别锥桶和施工标志,保持在正确车道内行驶,轨迹与使用真实数据训练的版本几乎一致。
研究团队将OpenLongTail作为完全开源的项目发布,提供生成好的长尾多视角数据、训练好的模型权重、数据转换工具和完整代码。这意味着任何研究机构或企业都可利用这套工具将单目长尾驾驶视频转化为训练多摄像头自动驾驶系统所需的数据。同时,团队也指出当前系统存在局限性,如扩散模型推理速度较慢、生成视频有时出现细微抖动伪影、处理不同摄像头时可能存在偏差等。未来研究方向包括提升生成速度、加入更精细的摄像头参数控制,以及开发智能数据源选择机制。











