CNIPA.AI
검색으로 돌아가기
기록

基于深度强化学习的机器人运动控制策略网络训练方法、机器人运动控制方法、装置、设备、机器人及存储介质

발명유효
28청구항 · 7 독립항
§ Ⅰ

개요

발명자

俞涛; 姚秀勇

IPC 분류

B25J 9/16 (2006.01)G06F 18/213 (2023.01)G06N 3/092 (2023.01)B25J 5/00 (2006.01)G05B 13/04 (2006.01)

本公开提供一种基于深度强化学习的机器人运动控制策略网络训练方法、机器人运动控制方法、装置、设备、机器人及存储介质,涉及机器人技术领域。本公开通过引入前向预测模型并与运动控制策略网络共享编码器输出特征,通过前向预测模型的状态损失与运动控制策略网络的策略损失的综合损失更新编码器、运动控制策略网络以及前向预测模型的参数,使运动控制策略网络在训练过程中能够自主学习和适应环境的变化,加快策略网络的策略收敛速度,提高样本的利用率、训练效率与泛化能力,使得机器人在执行动作序列时可生成良好的连贯平滑的姿态过渡动作,降低了动作突变或姿态切换僵硬的发生概率,提升机器人运动过程中动作的自然性与连续性。