CNIPA.AI
검색으로 돌아가기
기록

模型训练方法、机器人控制方法、装置和电子设备

발명유효
11청구항 · 5 독립항
§ Ⅰ

개요

발명자

黄冠; 叶安根; 朱政; 王啸峰; 张大朋; 张泽宇; 王泊远

IPC 분류

B25J 9/16 (2006.01)G06N 5/04 (2023.01)G06N 5/045 (2023.01)

本公开实施例公开了一种模型训练方法、机器人控制方法、装置和电子设备,构建链式推理数据集对训练预训练的策略网络,得到策略预测模型,以通过链式推理数据集来提供显式推理步骤,使得策略预测模型在训练时能学习如何逐步推理,避免在复杂指令中盲目输出动作,提高解释性和推断能力,并且使得策略预测模型学习输出包含可解释的链式推理文本与可直接执行动作数据,实现从高层任务描述到低层控制的闭环连接,使得策略预测模型结合链式推理文本做出动作数据的决策,可以减少策略预测模型输出的运动数据的错误率,而奖励函数联合优化策略预测模型,形成链式推理监督与可验证奖励相结合的训练框架,避免单目标奖励的局限,提高动作精度和鲁棒性。