AB
AiBoss站
快讯

任少卿时隔十年再署名论文,提出自动驾驶多模式世界—动作联合模型

据量子位报道,任少卿以通讯作者身份参与论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出一次生成多组场景—动作假设的自动驾驶规划方法。论文第一机构为NIO,目前结果基于公开数据集与仿真验证。

核心事实

据量子位报道,一篇题为《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》的论文近期公开,通讯作者为任少卿,第一机构为NIO,多位作者来自蔚来。公开学术记录显示,任少卿此前的代表性工作集中在2014—2016年,包括Faster R-CNN、ResNet等计算机视觉研究,此次是他时隔十年再次以通讯作者身份署名论文。

论文提出的MM-Future是一种多模式世界—动作联合模型。其思路是让模型一次生成多组“配对场景—动作假设”,每组内部的车辆轨迹与对应未来场景共同演化,最后再从中筛选。论文称,这使自动驾驶在规划时不仅考虑多条候选轨迹,也考虑不同轨迹可能带来的不同环境变化。

背景与影响

现有World–Action Model大致分两类:级联式方案先生成候选轨迹再预测未来场景,信息单向传递;联合式方案让场景与动作相互影响,但通常只生成单组结果。论文认为,真实道路需要同时覆盖多种结果并保持双向交互,因此设计了多模式联合生成、MM-Tokens紧凑表征以及Future-Conditioned Proposal Scorer筛选等环节。

论文使用NAVSIM与HUGSIM基准进行测试,并给出消融实验与延迟数据。论文同时指出,多组未来假设带来额外计算成本,主模型一次采样64组候选时端到端前向延迟约233毫秒;闭环测试中平均Route Completion略低于对比方案,极端难度下HD-Score也存在差距。作者还提到MM-Tokens属于隐式表征,可解释性有待提升。

限制与来源

上述内容来自量子位报道及论文公开信息,相关指标均为论文在公开数据集和仿真环境下的结果,尚未获官方确认可用于真实道路部署。论文地址为arXiv:2609.20377。功能、性能与可用范围请以论文原文及官方后续披露为准。