検索に戻る
案件記録

多自由度智能机器人肢体运动规划的试错控制方法及相关装置

発明有効
10請求項 · 4 独立
§ Ⅰ

案件概要

IPC分類

B25J 9/16 (2006.01)

本申请公开了一种多自由度智能机器人肢体运动规划的试错控制方法及相关装置,涉及人工智能、机器学习及机器人智能控制领域,该方法包括采集机器人执行多任务时的状态‑动作‑奖励轨迹数据,预处理得离线数据集。基于此构建含多个动力学子模型的集成模型,用生成对抗网络框架训练。依预测精度确定精英模型组,据此计算同一状态‑动作对的多个Q值估计。由各Q值估计标准差,得状态‑动作对的不确定性度量。用双重惩罚机制,依此度量优化状态‑动作对策略,部署至机器人控制器。若不确定性度量超过预设阈值,切换到安全控制模式;否则,直接执行优化策略输出的动作。本申请解决了现有离线强化学习在高风险决策场景中的局限。

外部リソース