CNIPA.AI
검색으로 돌아가기
기록

一种基于多任务强化学习的机器人运动控制方法及系统

발명유효
10청구항 · 4 독립항
§ Ⅰ

개요

발명자

孟文佳; 阚常方; 张藤; 黄伟

IPC 분류

B25J 9/16 (2006.01)

本发明涉及深度强化学习技术领域,提供了一种基于多任务强化学习的机器人运动控制方法及系统,包括:将机器人控制任务划分到对应任务组,每任务组具有独立的策略网络和价值网络;获取当前机器人状态,通过对应任务组的策略网络,得到控制指令,驱动机器人执行动作,得到环境反馈,价值网络评估执行动作的价值,反馈给策略网络,进行策略优化;其中,策略网络和价值网络的训练包括:从多个控制任务中采样轨迹,计算两两控制任务相似度,并构建相似度矩阵,通过聚类对控制任务进行分组,得到若干任务组,任务组内共享参数进行策略网络与价值网络的联合训练。提高强化学习模型的稳定性和整体性能,提高了机器人控制精度。