검색으로 돌아가기
기록
一种基于深度强化学习的工业机器人控制方法及系统
발명유효
10청구항 · 2 독립항
§ Ⅰ
개요
발명자
许建明; 邹保平; 程树英; 罗顺辉; 谭阿峰; 叶瀚; 李涛; 陈清雷; 黄顺平
IPC 분류
B25J 9/16 (2006.01)
本发明公开了一种基于深度强化学习的工业机器人控制方法及系统,所述方法包括以下步骤:构建包含机械臂、待检测物品、输送线及检测台体的虚拟仿真环境;设计深度强化学习的状态空间和动作空间;设计用于指导深度强化学习训练过程的奖励函数,奖励函数为任务奖励、效率奖励、安全奖励及技能奖励的加权组合;基于奖励函数,采用旨在最大化累积奖励与策略熵的深度强化学习算法,对策略网络进行分阶段训练;将训练完成的策略网络部署至机械臂的控制系统中,控制系统根据实时获取的当前状态生成控制动作,驱动机械臂执行待检测物品的上下料任务。本发明可保证控制精度、提高系统可靠性,并能保持较高的生产柔性。