검색으로 돌아가기
기록
一种基于多阶段混合学习的多运输装备协同运动控制方法和存储介质
발명유효
10청구항 · 2 독립항
§ Ⅰ
개요
발명자
王亚飞; 章翼辰; 郑凯文; 李若尧; 邬明宇; 陈进; 张骥远
IPC 분류
G05B 13/04 (2006.01)
本发明涉及自动驾驶与智能控制技术领域,尤其涉及一种基于多阶段混合学习的多运输装备协同运动控制方法和存储介质,包括:利用基于专家规则的单车运动控制算法生成专家示范数据,通过在线迭代式有监督学习对策略网络进行初始化训练得到预训练策略模型;将该模型参数载入多智能体强化学习的Actor策略网络中,采用中央化训练与去中心化执行范式,使多个智能体在仿真环境中进行交互训练,并基于复合奖励函数和广义优势估计对策略进行在线迭代优化,得到多车协同运动控制策略。本发明发挥模仿学习与强化学习的互补优势,提升训练效率、策略性能及系统在复杂场景下的协同作业能力与鲁棒性,可直接应用于露天矿山、港口等场景的运输装备群协同调度与控制。