ITBear旗下自媒体矩阵:

阿里千问推出开源自动驾驶新模型Qwen-Drive-1.0-4B 融合多能力助力驾驶技术升级

   时间:2026-09-06 21:40:19 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

阿里千问团队近日正式开源了自动驾驶领域的新模型——Qwen-Drive-1.0-4B。这款模型以Qwen3.5-4B为基础架构,专注于视觉语言与自动驾驶技术的深度融合,成为业内首个面向自动驾驶场景的视觉语言基础模型。

该模型在预训练阶段实现了3D感知、视觉问答与运动规划三大能力的统一。通过创新性的训练框架,团队不仅保留了原始视觉语言模型(VLM)的核心架构,还成功将驾驶任务所需的时空理解能力嵌入其中。这种设计使得模型既能理解复杂道路场景,又能生成符合交通规则的驾驶决策。

训练方案采用分阶段策略,将专业驾驶数据与通用视觉语言数据有机结合。在保持对交通标志、行人行为等通用视觉信息理解能力的同时,模型通过强化学习逐步掌握车道保持、变道超车等专项驾驶技能。官方评估显示,该模型在3D目标检测、场景语义理解等基准测试中表现优异,特别是在开环到闭环的驾驶任务迁移中展现出显著优势。

技术实现层面,模型构建了统一的轨迹表示框架,将不同数据集的驾驶轨迹数据转换为标准格式。这种标准化处理不仅提升了数据利用效率,还为跨数据集训练提供了可能。经过监督微调(SFT)的版本已在多项基准测试中达到行业领先水平,而强化学习(RL)优化后的版本更在驾驶安全性与人类偏好对齐方面取得突破性进展。

开发团队特别强调了数据构建的合规性,所有规划样本均来自公开数据集。通过创新性的评估体系,模型在虚拟驾驶环境中经历了从简单开环预测到复杂闭环控制的完整测试流程。实验数据显示,强化学习带来的开环位移误差增加不足3%,但闭环驾驶安全性指标提升超过20%。

目前该模型已在三大开源平台同步发布:GitHub提供完整代码库与训练配置,Hugging Face支持模型权重下载与在线推理,ModelScope则聚焦中文社区的技术交流与场景适配。开发者可通过任意平台获取模型资源,并根据实际需求进行二次开发或微调。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version