CNIPA.AI
返回搜索
档案

一种基于强化学习的机器人自适应训练方法、装置及介质

发明专利有效
10权利要求 · 4 独立
§ Ⅰ

卷宗概要

IPC 分类

B25J 9/16 (2006.01)

本发明涉及机器人训练的技术领域。具体涉及一种基于强化学习的机器人自适应训练方法、装置及介质,其方法包括利用高层策略网络生成任务子目标信息,将任务子目标信息输入至低层执行网络,依据任务子目标信息生成动作控制指令,并在执行过程中采集交互反馈信息,根据交互反馈信息计算奖励值,将奖励值与场景复杂度参数进行关联处理,执行动态奖励整形操作,生成调整后奖励信号,基于调整后奖励信号,生成经元学习优化的策略模型,在仿真环境中加载策略模型,生成经仿真训练优化的目标策略模型,将目标策略模型加载至机器人,控制机器人在实际交互场景中执行任务操作。本发明具有实现机器人在多交互场景下的自适应任务学习的效果。