CNIPA.AI
Back to Search
Dossier

一种基于强化学习的多UUV短时间的回收方法

InventionActive
10Claims · 2 independent
§ Ⅰ

Dossier Overview

Inventor

孙思卿; 王鹏; 毛柳伟; 董华超; 李靖璐

IPC Classification

G06Q 10/047 (2023.01)G06N 3/092 (2023.01)G06N 7/01 (2023.01)G06Q 10/067 (2023.01)

本发明公开了一种基于强化学习的多UUV短时间的回收方法,包括:利用子UUV动力学特性及相关约束完成回收作业模拟环境构建;创建经验回放池并为每一个子UUV分别构建策略网络以控制子UUV行动,并构建统一的价值网络对动作进行评价,形成集中式学习、分布式执行的架构;各子UUV的策略网络构建后产生策略,利用策略可以凭借探测器获得的局部状态生成子UUV当前时刻的动作;利用马尔可夫决策过程与回收作业模拟环境交互进行状态转移并储存;价值函数将使用全局状态进行训练,而到分布式执行阶段各子UUV的策略网络则使用局部状态进行决策;从经验回放池取样更新价值网络,采用策略梯度方法更新策略网络;训练好的策略网络分别部署到各子UUV上进行动作输出决策。

External Resources