来源:感算
发布时间:2026-08-07
2026年,自动驾驶的牌桌上,几乎所有人都在喊“世界模型”。
蔚来、小鹏、理想、华为、特斯拉、Waymo,各家都拿出了自己的方案。但细看下来,虽然都叫同一个名字,技术路线、落地方式,甚至对这个概念的理解,差别都不小。
都在做世界模型,到底在争什么?
蔚来走得很激进。它的世界模型直接接管方向盘、加速和制动,跳过中间规划层,端到端直控。路径更短,延迟更低。训练上,它用闭环强化学习让算法先在虚拟环境里试错,再部署到车上。但挑战也明显——同一套模型要跨四年十几款车型、两套芯片平台落地,工程化难度极高。
小鹏则是“两条腿走路”。第二代VLA学人类怎么开,世界模型学物理世界怎么变。一个管行动,一个管推演。刘先明说得很直白:世界模型提供的是比人类驾驶密集得多的监督信号,每一帧、每一次交互都能被预测。他还提出了X-Mind框架,让车在动之前先在“脑内”推演一遍。
理想不急着发产品,而是从底层啃。深度估计、三维重建、交通规则推理,一项一项做扎实。外界感知不强,但技术根基更深。当然,它也在推MindVLA,走VLA路线。
华为的思路很清晰:云端车端分工。云端用多智能体博弈和在线强化学习,训练效率拉满;车端用安全风险场实时决策。它明确跳过了VLA,认为世界模型在实时决策上效率更高,不追求可解释性。
小米试图把两条路捏在一起。开源的OneVL把VLA、世界模型和潜空间推理统一到一个框架里,推理延迟压到0.24秒,比传统VLA快了十几倍。但目前还在学术验证阶段,离工程化上车还有距离。
Momenta的R7是强化学习世界模型,三层架构:预训练压缩物理常识,仿真推演环境变化,虚拟训练场里反复试错。它已经在量产车上跑起来了,凯迪拉克和上汽大众都会首发搭载。
特斯拉和Waymo则把世界模型当仿真引擎用。特斯拉用真实画面重建3D场景,生成海量训练数据;Waymo基于Genie 3做世界模拟器,分三阶段训练。它们都不把世界模型直接部署到车端做实时决策,而是用来喂数据、测极端场景。
所以,差异在哪?
蔚来要的是执行效率,小鹏要的是认知与推演协同,理想在夯地基,华为在云端车端之间找平衡,小米在探索架构统一,Momenta在强化学习里找突破,特斯拉和Waymo则把世界模型当训练场。
没有哪条路是绝对正确的。有自研芯片和存量车的,敢把模型推上车端;算力和数据厚的,更倾向云端仿真。
但有一点是确定的:世界模型已经不再是PPT上的概念,它正在变成自动驾驶系统里真实运转的组件。这场竞赛,才刚刚开始。