CNIPA.AI
검색으로 돌아가기
기록

面向多场景自动驾驶的强化学习决策系统及方法

발명유효
8청구항 · 2 독립항
§ Ⅰ

개요

출원인

南京邮电大学

발명자

陈小柏; 刘一凡; 董乾; 陈敬宇; 肖甫

IPC 분류

G05D 1/43 (2024.01)G05D 1/65 (2024.01)G05D 1/633 (2024.01)G05D 1/644 (2024.01)G05D 1/648 (2024.01)G05D 109/10 (2024.01)

本发明属于自动驾驶及人工智能决策领域,公开了一种面向多场景自动驾驶的强化学习决策系统及方法,决策系统包括离线数据增强、通用基座模型训练与特定场景在线微调三大核心环节,首先,采用扩散模型生成多样化轨迹数据并通过安全约束筛选;其次,利用Cycle‑VAE分离场景不变特征与场景特定特征,基于场景不变特征通过保守Q学习训练通用决策策略;最后,采用浅层冻结策略,仅对深层参数进行近端策略优化在线微调。本申请实现了自动驾驶决策模型在城市、高速、乡村等多场景下的快速适应与高鲁棒性决策。