训练一个自动驾驶模型要经历哪些环节?

[首发于智驾最前沿微信公众号]根据中商产业研究院发布的《2026-2031年中国具身智能机器人深度分析及发展前景研究预测报告》,2025年中国自动驾驶市场规模达到4502亿元,同比增长17.5%,预计2026年将增至5293亿元。

在这组数字背后,支撑自动驾驶能力持续进化的,是一套极其复杂的模型训练体系。

而想要训练一个能上路的自动驾驶模型,远不只是将数据喂给算法那么简单,需要经过一套复杂的流程。

01数据从哪来,又该怎么筛?

训练一个自动驾驶大模型,首先要做的是进行数据采集,一辆具备高阶智驾能力的车辆,每天产生的传感器数据可达TB级别。

这些数据来自摄像头、激光雷达、毫米波雷达等超过50个传感器,每日可上传十几GB。

随着车队规模扩大,总数据量可迅速攀升至数十PB甚至上百PB。

但想让数据全量回传是不现实的,网络成本和云端存储成本就无法承受。因此,车端必须具备在行驶中自动筛选高价值场景的能力。

现阶段,行业主流做法是影子模式。

即在人类驾驶员操控车辆时,算法在后台同步运行并独立做出决策判断,系统实时比对算法判断与驾驶员实际操作,一旦出现显著分歧,就自动触发数据回传。

这种机制可将人类驾驶员的日常操作作为真值参照,系统无需人工干预就能自动发现模型表现不佳的场景。

还有一种方式是主动学习。

即云端向车队下发包含目标场景特征的触发条件配置,车端部署的触发器在行驶中持续匹配这些特征,一旦命中就打包上传对应时段的数据。

据理想汽车自动驾驶高级算法专家詹锟在ICCV 2025上披露,理想目前已建立覆盖200多个触发条件的回传机制,单次触发可生成15至45秒的高价值片段数据。

这种定向采集方式让系统能够根据模型训练需求主动寻找特定场景,大幅提升了进入训练集的数据价值密度。

02数据上云之后

处理环节有多复杂?

数据回传后,接下来要做的就是清洗和标注。

提取-转换-加载(ETL)管道需要对PB级数据集进行去重、异常值清洗及时间对齐,将来自摄像头、激光雷达、毫米波雷达等多传感器的原始数据整合为可用的结构化数据。

数据清洗整合完毕后,便进入标注环节,标注环节的传统做法大量依赖人工。

以3D激光雷达点云标注为例,一帧数据的粗粒度标注就需要10分钟以上,一个小时的连续点云数据可能需要耗费上千人天的标注工作量。

腾讯披露的数据显示,传统人工标注成本约为17元/帧,单人每天仅能完成3帧,完成50万帧标注需投入850万元、16.7万人天。

现阶段,行业正在快速推进标注自动化,4D自动标注则是当前的主流方案。

该方案在3D空间坐标之上加入时间维度,对点云和图像数据进行跨时序的连续标注。

通过智能化标注技术,部分案例已实现超过90%的自动化率,生产效率达2500帧/TFlops/人/日。

wKgZPGp_x_mAMUBEAMnLSwAbicY332.jpg

图片源自:网络

与此同时,合成数据也正在成为越来越重要的数据来源。

2023至2025年,智能辅助驾驶训练数据中合成数据的占比从20%-30%升至50%-60%,合成数据已经成为填补长尾场景的核心资源。

以理想汽车为例,其利用世界模型重建历史场景并扩展变体,合成数据占比已超过90%。

英伟达则通过Cosmos世界基础模型与Omniverse仿真平台,将数千英里真实驾驶数据扩展为数十亿英里虚拟驾驶里程。

对于数据的存储,行业普遍采用分层存储架构来平衡性能与成本。

热数据(频繁访问、对延迟敏感、直接影响业务响应速度的数据)存放在NVMe SSD或并行文件系统中以保证高速读取。

冷数据(长期不被访问、访问频率极低、主要用于合规归档或历史回溯的数据)则下沉至对象存储以降低长期存储开销。

但这种方式依然存在一些问题。

在大模型训练阶段需频繁访问由数亿张图片帧及其对应标注组成的海量小文件

这种场景下,存储系统的元数据服务每读取一个文件都需要先执行一次查询定位。

当文件数量达到亿级甚至百亿级时,元数据处理能力本身就成了制约并发读取的关键瓶颈。

03模型训练,算力和算法如何配合?

数据准备好之后,就会进入模型训练阶段,这个环节对算力的需求极为惊人。

全球范围内,截至2025年8月,特斯拉的云算力大约为100 EFLOPS,居全球首位。

国内阵营中,吉利星睿智算中心2.0的综合算力达到23.5 EFLOPS,在中国车企中排名第一。

华为乾崑智驾的云端算力在2025年9月达到45 EFLOPS,到2026年4月已进一步提升至60 EFLOPS。

理想汽车截至2025年中期的总算力为13 EFLOPS,其中10 EFLOPS用于训练、3 EFLOPS用于推理。

小米截至2025年2月的智驾总算力达11.45 EFLOPS。

小鹏已建成国内汽车行业首个万卡智算集群,云端模型工厂拥有10 EFLOPS的算力。

拥有算力只是前提,能否将这些算力真正用起来,取决于存储系统能否及时、稳定地向GPU输送训练数据。

数千个GPU节点需要持续读取海量的已标注样本进行模型训练,在大模型训练场景中,数据供给速度必须与GPU计算能力相匹配。

一旦存储I/O成为瓶颈,昂贵的GPU算力将因等待数据而大量闲置。

当各家的算力数字不断攀升时,真正决定训练效率的反而是数据能否被及时喂给GPU。

在算法架构层面,行业也正从模块化设计向端到端架构迁移。

端到端模型直接从传感器输入生成规划控制结果,以人类驾驶操作为监督信号进行训练。

其不再依赖道路线、障碍物边框这类环境中间的标注结果,简化了传统架构中感知、预测、规划各模块之间的信息传递损耗。

据IIM信息发布的《全球及中国自动驾驶数据闭环产业全景展望报告(2026)》,2026年搭载端到端架构的自动驾驶系统在全球新量产车型中的渗透率达到18.7%,较2024年提升了12个百分点。

不过,端到端模型从学术研究走向量产落地,仍存在一些需要解决的问题。

这类模型主要依赖离线的人类驾驶数据集进行训练,数据集覆盖的场景状态有限,遇到训练分布之外的场景时表现不稳定。

更重要的是,离线训练缺乏闭环反馈机制,模型无法在虚拟环境中试错并获得奖励信号来修正自身策略。

部署到实车后遇到训练中未充分覆盖的情形,误差会在决策链条中逐步累积。

现阶段,头部玩家已在推进端到端的量产落地。

以理想汽车为例,其自动驾驶高级算法专家詹锟在ICCV 2025上披露,理想端到端量产版本的MPI(每次人工干预之间的平均行驶里程)已达到220公里以上,相比2024年7月底的版本翻了19倍左右。

从演进路径来看,2024年7月第一个无图版本的MPI仅约十几公里,到2024年底综合MPI达到约100公里,再到2025年三季度突破220公里。

这一增长曲线说明端到端架构在量产场景中的稳定性正在被逐步验证。

04仿真验证为什么成了必选项?

模型训练完成后,还不能直接部署到车上,而是要先进行仿真验证。

仿真验证是介于训练和实车测试之间的关键环节,相比于实车测试,仿真测试安全性更高、成本更低、效率更快。

当前仿真平台正在经历一次技术升级。

国产智驾仿真平台SimOne引入了4DGS技术,构建了下一代分布式架构的仿真体系和世界建模新范式,实现了实采场景的仿真一体化。

4DGS技术赋予真实数据强泛化能力。

基于4DGS构建的端到端仿真体系,可利用不同品牌、型号车辆及其他障碍物的资产进行替换,并确保替换资产与场景光照、阴影、反射等保持一致。

此外,仿真验证也已从单纯的测试评估走向了训练闭环。

英伟达新推出的AlpaGym便是一个开源的闭环强化学习框架,在仿真环境中可对模型进行连续决策循环训练,而不是依赖静态记录数据。

这种方式能够让模型从自身决策的后果中学习,暴露开环训练所忽略的累积误差和边缘案例失效问题。

仿真验证还可将真实采集的场景数据(尤其是长尾场景)注入数字孪生平台进行高并发回放。

英伟达的OmniDreams生成式世界模型就支持开发者大规模仿真罕见的长尾驾驶场景。

05从数据闭环到训练闭环

行业正在发生什么变化?

想训练一个好的自动驾驶大模型,离不开数据闭环。

传统的数据闭环包含影子模式验证、数据触发回传到云端、数据挖掘、自动标注、生成训练集、模型训练、模型下发验证性能等环节。

这个流程已能将数据回传压缩到分钟级。

但数据闭环的核心逻辑是从真实世界里找问题。

需先在车端发现模型表现不佳的场景,回传后再进行标注和训练,然后把修复后的模型部署回去验证。

这套机制对已出现的问题很有效,却受制于一个现实,那就是真实行驶中遇到长尾场景的概率极低。

交通管制、烟花燃放、前车掉落异物这类情形,人类驾驶员一年也碰不上几次,单纯依靠真实数据采集来覆盖这些场景,收敛速度非常缓慢。

这也是行业从数据闭环走向训练闭环的根本原因。

数据闭环依赖真实世界的数据采集,训练闭环则让模型在虚拟环境中自主探索和学习。

两者的本质区别在于,数据闭环是发现问题再修复,训练闭环是预见问题并提前应对。

训练闭环的核心架构可以概括为VLA(视觉-语言-行动模型)+强化学习+世界模型。

世界模型提供可交互的仿真环境,3D资产在其中构建多样化的静态场景,可交互的智能体模拟交通参与者的动态行为,奖励模型则对模型的每一次决策给出准确的反馈信号。

模型在这样一个虚拟环境中反复试错,每一次决策都会影响下一时刻的环境状态,从而在闭环中持续优化自身策略,补齐数据闭环在长尾场景覆盖上的短板。

06最后的话

训练一个自动驾驶模型,早已不是单一环节的技术突破。

合成数据与真实数据的混合供给、自动化标注对人工成本的压缩、存储与计算之间的性能匹配、仿真对长尾场景的提前覆盖,每一个环节都决定了算力能否被真正用起来,模型能否持续进化。

而数据闭环向训练闭环的演进,则标志着这场竞赛从发现问题后修复进入了预见问题并提前应对的新阶段。

  • 随机文章
  • 热门文章

您可以还会对下面的文章感兴趣:

暂无相关文章