自动驾驶行业迎来一个能「讲道理」的开源模型。8 月 4 日,英伟达正式发布 Alpamayo 2 Super:一个 32B 参数的开源推理型视觉-语言-动作(VLA)模型,面向 Robotaxi 与 L4 自动驾驶,采用 OpenMDW-1.1 许可开放商用——商用、微调、再分发均允许。它的核心卖点不是「会开车」,而是「会解释」:每一次驾驶决策都能说出因果逻辑。
一个会「解释自己」的驾驶模型
传统自动驾驶是个黑盒:输入摄像头画面,输出方向盘角度,中间发生了什么没人知道。Alpamayo 2 Super 要解决的就是这个问题。对每个驾驶情境,它在一次前向推理中同时输出五类结果:
- 轨迹:车辆计划行驶的路径;
- 因果链(CoC)推理轨迹:解释这个决策背后的原因;
- 元动作:让行、变道、停车等高层次意图;
- 推理自动标注:为训练和验证数据生成因果链标注;
- 带 2D 定位的视觉问答:把模型的回答链接到摄像头图像的具体区域。
英伟达官方博客称,这套设计让开发者能把「模型看到了什么」与「模型选择了什么」对应起来,决策更易理解、评审和验证。因果链轨迹还集成了英伟达 Halos 安全验证流程,与 ISO/PAS 8800 标准对齐,为自动驾驶安全工程提供支撑。
榜单第一:超 GPT-4o 23 分
在自动驾驶推理基准 LingoQA(Lingo-Judge 指标)上,Alpamayo 2 Super 以 79.2 分排名第一,在约 40 个参评模型中位居榜首,超出 GPT-4o 23.2 分、超出 Gemini 2.5 Pro 15.1 分(该成绩为英伟达官方口径)。模型基于英伟达 Cosmos 3 Super Reasoner 构建,经过强化学习后训练,参数规模约为 Alpamayo 1.5/1(10B)的三倍。
英伟达对这次发布的定位很明确:物体检测和运动预测对自动驾驶来说已基本解决,真正的难题是「长尾场景」——无保护转弯、模糊的合流、多车多行人同时博弈。处理这些场景,需要模型理解局势、推理因果、选择行动,并且能用工程人员可检查验证的方式解释这个选择。Alpamayo 2 Super 将 360 度多路摄像头画面融合进单次推理,正是冲着这类场景去的。
最「商业化」的部分:自动标注
对自动驾驶企业来说,Alpamayo 2 Super 最具商业价值的能力是自动标注。它可以作为自动标注器,把原始、无标注的整车路测视频转化为更丰富的训练数据,把标注周期从数月压缩到数天。无论是否在车内运行这个模型,这一能力都能直接降低数据成本——这可能是本次开源最先落地的商业价值。
模型权重托管在 Hugging Face,推理代码在 GitHub,自动标注流水线一并开源。官方博客称,Alpamayo 家族在 Hugging Face 上的下载量已超过 50 万次,是平台上采用度最高的开源自动驾驶推理模型家族。
几个需要说清楚的边界
第一,完整模型不是拿来装进车里的。Alpamayo 2 Super 定位是「教师模型」(teacher model),面向云端开发与蒸馏,需要数十 GB 显存,通过蒸馏成更小的版本后运行在英伟达 DRIVE 车载芯片上。第二,「LingoQA 第一」是英伟达官方口径,榜单数据反映推理能力,不等同于道路实测成绩。第三,这种「给模型、卖芯片」的模式意味着,行业若标准化在英伟达的模型、工具与数据上,也会标准化在它的芯片上——开源背后依然是平台战略。
无论如何,一个开源、可商用、能解释决策的驾驶模型,正在把 Robotaxi 的「黑盒」打开一角。当自动驾驶汽车有一天能回答「你刚才为什么急刹车」,人与机器的信任关系,或许才真正开始建立。
对行业与普通人的影响
从行业视角看,Alpamayo 2 Super 的发布时机耐人寻味:全球 Robotaxi 正从试点走向付费服务,Uber 在慕尼黑的自动驾驶出行、多家车企的 L4 车队都在推进中,而「出了事故怎么解释、怎么定责」始终是商业化路上绕不开的信任门槛。一个能输出因果链推理、让工程师逐条审计决策依据的开源模型,等于把「可解释性」从加分项变成了行业默认配置的候选方案。
对普通读者而言,这件事还有一个更贴近生活的角度:开源模型的普及正在降低自动驾驶的研发门槛。过去只有头部公司玩得起的「推理型驾驶大脑」,现在任何团队都能下载权重、微调、蒸馏,Robotaxi 的竞争将从「拼参数」转向「拼数据、拼场景落地」。英伟达把模型开源、把芯片留下,本质是在赌「谁掌握平台谁赢」——而这场赌局的受益者,最终会是更快用上安全、廉价自动驾驶服务的普通乘客。




我要评论
登录后即可发表评论