検索に戻る
案件記録
面向关键自动驾驶场景稳定决策的大语言模型增强的强化学习训练方法
発明有効
5請求項 · 1 独立
§ Ⅰ
案件概要
発明者
徐东伟; 乔恩文; 顾同成; 王清松; 万子璐; 付宏达; 孙成巨; 郭海锋; 刘禹卿
IPC分類
G06N 3/092 (2023.01)B60W 60/00 (2020.01)G06N 3/042 (2023.01)G06N 3/045 (2023.01)G06N 3/006 (2023.01)G06N 5/04 (2023.01)G06N 5/045 (2023.01)
一种面向关键自动驾驶场景稳定决策的大语言模型增强的强化学习训练方法,构建基于LLM的车辆决策智能体,通过链式思考技术和知识经验池提供高水平指导策略;然后,基于环境风险标志和决策边界参数共同构建动态干预机制,从而决定LLM指导时机;最终,通过专家指导算法设计,采用自适应探索‑模仿融合损失函数将LLM的先验知识有效融入深度强化学习策略网络。本发明的DRL模型在车辆驾驶决策任务中表现更优,并在多类场景下展现出更强的泛化能力,本发明能显著提升DRL模型的鲁棒性、样本效率与整体泛化水平。
外部リソース