검색으로 돌아가기
기록
面向多场景自动驾驶的强化学习决策系统及方法
발명유효
8청구항 · 2 독립항
§ Ⅰ
개요
출원인
南京邮电大学
발명자
陈小柏; 刘一凡; 董乾; 陈敬宇; 肖甫
IPC 분류
G05D 1/43 (2024.01)G05D 1/65 (2024.01)G05D 1/633 (2024.01)G05D 1/644 (2024.01)G05D 1/648 (2024.01)G05D 109/10 (2024.01)
本发明属于自动驾驶及人工智能决策领域,公开了一种面向多场景自动驾驶的强化学习决策系统及方法,决策系统包括离线数据增强、通用基座模型训练与特定场景在线微调三大核心环节,首先,采用扩散模型生成多样化轨迹数据并通过安全约束筛选;其次,利用Cycle‑VAE分离场景不变特征与场景特定特征,基于场景不变特征通过保守Q学习训练通用决策策略;最后,采用浅层冻结策略,仅对深层参数进行近端策略优化在线微调。本申请实现了自动驾驶决策模型在城市、高速、乡村等多场景下的快速适应与高鲁棒性决策。