五个月实习工作总结
实习周期:2026 年 3 月中旬至 2026 年 8 月中旬
方向:自动驾驶决策规划——路口场景数据、模型训练与仿真评测
一、实习概述
过去五个月,我的工作从熟悉自动驾驶决策规划研发环境与基础算法开始,逐步深入到路口场景的数据生产、数据质量治理、模型训练评测、仿真问题分析和可视化工具优化等完整链路。工作重心始终围绕路口转弯模型展开,覆盖人驾/自驾数据、左转/右转等典型场景;在实际项目中,我逐步具备了从发现问题、定位数据或工程原因,到组织实验和沉淀可复用流程的能力。
二、阶段性工作回顾
1. 3 月:完成环境融入,建立工程与业务认知
- 完成公司规范、安全培训及 Autocar/Walle2 开发环境、代码编译、Mviz/Replay 仿真工具链的配置和使用。
- 学习决策规划基础知识,包括轨迹有效性判断、路口转向逻辑、计算几何(曲线、凸包、AABB/OBB 等)以及 PnC 基础概念。
- 在
isTrajectoryOutgoingEdgeValid等逻辑上进行实践:引入自车转向完成度,使用角度差、饱和线性插值等方法优化动态边界判断;完成代码格式化、分支开发、PR、仿真回归及 diff report 分析的基础闭环。 - 通过阅读上线文档、复现仿真 Case 和记录问题,建立了对大型工程代码、研发流程及质量验证方式的初步理解。
2. 4—5 月:修复并重构路口人驾数据生产链路
- 深入 RA、Data Engine、Jenkins、MLP、数据集平台等工具链,梳理并维护路口人驾数据 Pipeline。
- 系统定位并处理上游数据缺失、路径不一致、Proto 迁移、Dataset 加载、空数据集、Ray Worker 临时文件读取等问题;沉淀了从 Jenkins → MLP → Parquet → Dataset 的问题排查思路。
- 梳理人驾数据处理的五步链路:有效路口事件提取、RA 专家帧处理、路口片段筛选、按左转/直行/右转分类聚合等,并明确正常帧、路口类型、车辆状态、车速、交通灯距离等过滤逻辑。
- 完成缺失人驾数据的排查与补齐计划,整理数据来源、去向和日期记录;对比人驾与自驾 Pipeline 的上游数据量和分布,定位人驾上游存在数据缺失和异常帧占比较高的问题。
- 推进每日/每周路口数据收集 Workflow,减少手工重复操作,并形成 Pipeline 修复和数据预处理文档。
3. 5—6 月:构建路口数据集并跑通模型训练闭环
- 构建覆盖 2025 年 6 月至 2026 年 5 月的路口右转自驾数据集:从 SQL 提取路口场景、执行 RA 挖掘、应用数据质量过滤、完成时间戳对齐,使数据可直接用于特征导出。
- 数据集规模从原始的 2,788,777 个 Case / 13,500.99 小时,经过质量过滤后沉淀为 1,081,369 个 Case / 3,446.43 小时 的右转自驾训练数据;同时构建人驾右转数据集并完成时间戳对齐。
- 推进路口左转数据重刷、特征导出、训练与评测,组织通用 23 万、人驾 12 万、自驾 29 万样本的数据组合,完成 Query Decoder 的特征导出、Backbone/Head 训练、ONNX 导出和仿真评测。
- 适配 Shared Encoder 6.3 与训练环境,处理模型配置、特征/标签命名、预训练权重、分支冲突和 Docker 环境问题;沉淀特征导出、训练、评测分支及常见报错处理经验。
- 分析回归结果中的成功与失败 Case,识别轨迹避让、选道、曲率平滑等改善,也识别减速过度、让行失败、参考线异常、撞 curb 等问题,为后续模型迭代提供依据。
4. 7—8 月:推进路口模型复现、场景分析与可视化完善
- 完成 Junction Model V2.1、JunctionTurn Decoder 等模型在 SE 6.3 环境下的数据重刷、特征导出、训练和评测适配,并持续分析人驾数据质量和 Daily 链路问题。
- 开展 AR + IL 路口场景复现,以及 LogSim Case 归档和分析,提升对模型行为与仿真场景的理解。
- 参与挂式卡车(Articulated Truck)交互场景挖掘与数据集构建,拓展了对特殊车型和复杂交互场景的数据需求理解。
- 优化 Mviz Junction Model Widget 的可读性,包括字体尺寸和轨迹虚线间距调整;进一步开展 React Decider 可视化探索,增强模型调试和结果观察效率。
- 完成训练分支向
devel的适配,处理配置、依赖和代码合入问题,增强了对持续集成、分支演进和研发协作的认识。
三、核心产出
- 数据生产与治理
- 修复并维护路口人驾 Daily Pipeline,完成数据链路、异常原因和补齐计划的文档化。
- 设计路口数据自动收集 Workflow,覆盖驾驶模式、转向类型、RA 结果融合、过滤和分布统计。
- 构建大规模路口右转自驾与人驾数据集,完成数据筛选、质量过滤、时间戳对齐和训练可用性验证。
- 模型训练与评测
- 跑通 Query Decoder 的“数据重刷—特征导出—Backbone/Head 训练—ONNX 导出—仿真评测”全流程。
- 完成 SE 6.3 相关适配,沉淀模型配置、训练脚本、分支和问题排查记录。
- 基于回归仿真进行代表性 Case 分析,输出模型表现改善点及风险点。
- 工程与工具优化
- 参与路口转向判断、参考线/距离场性能思考及仿真一致性验证。
- 优化 Mviz 路口模型展示效果,并探索 Decider 可视化。
- 持续沉淀数据预处理、Pipeline 修复、模型训练、问题 Case 等文档,降低后续复用和交接成本。
四、能力成长与反思
能力成长
- 工程能力:从完成本地编译和简单改动,逐步能够独立处理分支开发、PR、Rebase/Cherry-pick、Proto 迁移、Jenkins/MLP 任务提交和仿真回归。
- 数据能力:建立了从上游数据、SQL/RA 挖掘、Parquet、Dataset、过滤规则到特征导出的链路认知,能够基于数据量、分布和异常 Case 进行排查。
- 模型能力:理解了路口转弯模型的训练数据构成、特征/标签配置、预训练模型接入、模型导出和回归评测流程。
- 问题定位能力:从单点报错处理逐步转向沿数据流、任务依赖和运行环境进行系统定位,并将有效结论沉淀为文档。
- 协作与表达能力:通过上线文档、Pipeline 修复总结、数据集说明和 Case 集合,将过程和结论结构化,提升与上下游同学协作的效率。
后续改进方向
- 在接手陌生模块时,先建立“工具—代码—数据—任务依赖—产出”的整体地图,再进入具体修改,减少局部试错。
- 强化数据质量指标和自动化校验,将数据量、过滤损耗、时序对齐、异常 Case 等检查前置到 Workflow。
- 将训练和评测进一步做成可复现实验模板,规范数据版本、配置、权重、模型产物和回归报告的溯源关系。
- 继续深入复杂交互场景与模型行为分析,将仿真 Case 结论反哺数据挖掘、样本构建和模型迭代。
五、总结
五个月实习期间,我完成了从“熟悉自动驾驶决策规划研发环境”到“能够参与路口数据、模型和仿真全链路迭代”的转变。最重要的收获不仅是完成若干数据集、训练任务和工程修复,更是形成了以数据质量为基础、模型训练为核心、仿真评测为验证、文档沉淀为复用的研发方法。后续我将继续提升端到端问题拆解、实验设计和复杂场景分析能力,为路口模型的稳定迭代贡献更扎实的工作产出。