具身智能新手名词表English

DriveVLM(快慢双系统智驾)

DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models进阶

清华与理想汽车 2024 年提出:视觉语言模型慢思考、传统规划器快执行的智驾方案。

DriveVLM 是清华大学交叉信息研究院赵行团队与理想汽车于 2024 年 2 月提出的自动驾驶方法,发表于 CoRL 2024。传统自动驾驶流水线应对罕见、复杂的长尾场景能力有限。DriveVLM 用视觉语言模型(VLM,底座为 Qwen-VL)按思维链做三步:场景描述、场景分析、分层规划,最后给出行驶轨迹。但 VLM 空间定位不够精确、推理又慢,于是论文提出 DriveVLM-Dual:VLM 低频输出粗略参考轨迹(慢系统),传统感知与规划模块以高频把它细化成实际轨迹(快系统),两者异步协作。论文称该系统已部署到量产车上,在两颗 Orin X 芯片的车载平台上平均推理约 410 毫秒。这种分工与机器人领域的快慢双系统架构(如 Figure 的 Helix)思路一致。

例子遇到少见路况时,VLM 先描述场景、找出会影响本车的关键物体并分析其影响,再给出「减速、绕行」这类高层决策和粗略轨迹,由传统规划器实时细化成可执行轨迹。

也叫
DriveVLM-Dual
相关
快慢双系统、自动驾驶、视觉语言模型、思维链、长尾问题、通义千问 Qwen-VL
来源
DriveVLM (arXiv 2402.12289)
DriveVLM 项目主页
信息截至
2024-11

在完整名词表里查看 →