【摘要】

2025年5月,我作为核心系统架构师,主导了某新能源头部车企“新一代自动驾驶数据闭环平台”的重构与升级工作。该平台主要为集团现役海量智能汽车提供长尾场景(Corner Case)挖掘、自动驾驶数据清洗标注以及仿真场景自动化重建等核心闭环功能。本文以该项目为例,深入论述了基于大模型架构(RAG与Agent)的系统设计与实践。文章主要从三个核心论点展开:用基于多模态向量数据库与大语言模型协同的RAG技术方案,解决传统标签检索无法应对长尾场景复杂语义理解的业务痛点,实现海量路测数据高效挖掘与精准定位的效果;用基于ReAct范式的智能体集群结合3D Occupancy自动化流水线方案,解决纯人工标注自动驾驶数据成本高昂且周期漫长的问题,实现从数据清洗到预标注全流程自动化的效果;用私有化视觉大模型配合vLLM框架与Triton底层算子优化的技术方案,解决超大参数模型在海量视频帧处理时推理延迟极高的计算瓶颈问题,实现兼顾企业数据隐私与毫秒级闭环流转的极致运行效果。该平台已于2026年初正式全量上线,Corner Case挖掘效率提升了五倍,显著加速了自动驾驶算法的迭代周期,圆满完成了既定的技术攻坚目标。

【正文】

随着公司自动驾驶功能的量产落地,车队每天回传的数据量达到PB级别。然而,原有的数据处理链路面临着巨大的挑战。在场景挖掘方面,传统基于人工标签(Tag)的检索系统根本无法处理复杂的业务语义,当算法工程师需要寻找“下雨天,前方有穿着雨衣的骑行者突然横穿马路”这种复杂长尾场景时,传统SQL束手无策。在数据标注方面,过度依赖外包团队进行人工标注,成本极高且周期长,严重拖累了感知模型的快速迭代需求。同时,数据挖掘、标注、仿真等环节的工具链各自为战,缺乏一个统一的智能调度中枢。为彻底打破这一僵局,公司决定引入前沿的大模型技术对整个数据闭环进行重构。作为该项目的核心架构师,我全面负责平台的技术路线制定与落地实施,确立了以大模型为核心大脑,以RAG(检索增强生成)为场景记忆库,以Agent(智能体)为自动化执行工具的全新架构体系。

一、在多模态数据检索模块的重构中,我用基于多模态向量数据库与大语言模型协同的RAG(检索增强生成)技术方案,解决了传统标签检索无法应对长尾场景复杂语义理解的业务痛点,实现了海量路测数据高效挖掘与精准定位的效果。自动驾驶系统的瓶颈往往在于那百分之五的极端Corner Case。为了让工程师能用自然语言“对话式”挖掘数据,我摒弃了原有的关系型标签库,重构了底层检索架构。在多模态向量化阶段,针对2D视频关键帧,我们采用CLIP及其变体提取图像特征向量;而针对3D点云数据,考虑到CLIP并非原始3D点云特征提取的标准工具,我引入了专用的3D点云编码器(如VoxelNet),并在BEV(鸟瞰图)空间下完成多模态特征的融合与时空对齐。融合后的高维向量被统一存储在Milvus分布式数据库中。当工程师输入自然语言查询时,系统首先进行近似最近邻搜索(ANN)召回候选片段,随后利用部署的视觉大语言模型(VLM)进行二次逐帧视觉查验,确认场景中是否存在违规锥桶或遮挡行人等具体细节。这一设计不仅完美解决了多模态数据对齐难题,更将复杂长尾场景的挖掘准确率跃升至百分之九十五以上。

二、在数据标注流水线的设计上,我用基于ReAct范式的智能体(Agent)集群结合3D Occupancy自动化流水线方案,解决了纯人工标注自动驾驶数据成本高昂且周期漫长的问题,实现了从数据清洗到预标注全流程自动化的效果。数据标注是整个闭环中最繁重、最耗时的体力活。为了解放人力,我设计了“Annotation Agent”标注智能体来接管核心调度工作。我们将现有的2D检测算法,以及利用高精度定位与多帧点云拼接技术构建的3D Occupancy自动化标注数据集流水线,全部封装为Agent可调用的工具集(Tools)。当Agent接收到海量回传数据时,会根据ReAct范式进行自我思考与规划:首先调用初筛工具剔除无效静止画面;接着调用3D Occupancy和车道线工具生成高质量的预标注结果;最后,智能体还会调用VLM大模型对预标注的边界框进行“自我反思与视觉质检”。如果发现遗漏或严重遮挡,系统会自动微调修正,仅将极少数的疑难帧推送到人工审核队列。这种“AI标注+AI质检”的自动化智能体编排模式,直接将整体人工介入率削减了百分之八十。

三、在仿真场景生成与底层算力支撑模块,我用私有化视觉大模型配合vLLM框架与Triton底层算子优化的技术方案,解决了超大参数模型在海量视频帧处理时推理延迟极高的计算瓶颈问题,实现了兼顾企业数据隐私与毫秒级闭环流转的极致运行效果。为了将挖掘出的真实事故数据快速泛化为成千上万个虚拟仿真用例,我设计了Simulation Agent,让它提取真实环境要素并生成OpenSCENARIO格式的仿真测试代码。然而,在应用层表现优异的大模型,在底层计算时却遭遇了滑铁卢。处理海量视频帧和复杂上下文导致我们私有化部署的8B参数级别的多模态模型推理极度缓慢,GPU显存频繁溢出。作为架构师,我带领团队深入底层框架进行极限调优。我们引入了vLLM与SGLang等前沿推理加速框架,并针对模型结构中的RMSNorm层,手工编写并实施了基于Triton内核的算子级优化项目,最大化榨干了底层GPU硬件的并发吞吐能力。结合动态抽取视频关键帧的策略,系统处理复杂长尾视频片段的耗时被大幅压缩,彻底打通了云端数据处理链路的性能任督二脉。

经过大半年的日夜奋战,基于大模型架构的新一代数据闭环平台于2026年初顺利全量上线。在日常业务运行中,算法工程师挖掘一个复杂极端场景的时间从过去的数天锐减至几十分钟内,自动标注流水线更是为公司节省了每年数千万的外部采购成本,核心交易链路与算力调度稳如磐石。回顾这次架构升级历程,我深刻体会到大模型不仅仅是车端自动驾驶的智驾大脑,更是云端数据工厂的灵魂。作为架构师,不能仅仅浮于API的调用,更要深入到底层算力优化与数据特性的本质。在未来的规划中,我计划进一步探索端到端的具身智能(Embodied AI)以及更高级别的世界模型(World Models)在数据闭环中的应用,赋予智能体预测物理世界演变的强大能力,在现有的基础架构之上,持续构建更加逼真、高效的自动驾驶云端数字底座。

记忆图谱(考场速记版 - 自动驾驶版)

  1. 底层(数据层 - 多模态 RAG):

    • 关键词: 多模态向量 (CLIP/BEV)、Milvus、语义检索 (Text-to-Video)。

    • 作用: 用自然语言搜出 Corner Case(长尾场景),解决“大海捞针”难题。

  2. 中层(逻辑层 - Agent 编排):

    • 关键词: ReAct 范式、Annotation Agent (自动标注)、Simulation Agent (场景重建)。

    • 作用: 自动调用工具做清洗、标注、仿真,替代人工流水线。

  3. 顶层(服务层 - 效能保障):

    • 关键词: VLM (视觉大模型)、vLLM 加速、OpenSCENARIO 生成。

    • 作用: 这是一个“AI 标注员”和“AI 仿真工程师”,又快又准。

金句(背诵):

  • “RAG 将海量路测数据变成了可对话的‘场景知识库’。”

  • “Agent 将繁琐的数据处理工具链串联成了自动化的‘智能流水线’。”

  • “大模型在云端重构了自动驾驶的数据闭环,实现了从‘人工驱动’到‘数据驱动’的质变。”

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐