検索に戻る
案件記録
基于混合目标重标记的机械臂策略学习方法及系统
発明有効
6請求項 · 2 独立
§ Ⅰ
案件概要
発明者
朱树; 刘洋; 唐文来; 王龙龙; 陈铭; 靳钱; 刘蓉
IPC分類
B25J 9/16 (2006.01)
基于混合目标重标记的机械臂策略学习方法及系统,该方法针对多目标强化学习中稀疏奖励导致的样本效率低和策略收敛难的问题,提出了一种改进的经验回放机制。方法包括:构建包含状态、动作及目标空间的马尔可夫决策过程;控制机械臂与环境交互并存储轨迹数据;在训练阶段,采用“Next‑Future”混合策略对采样数据进行目标重标记,即强制选取当前转换的下一状态作为虚拟目标以确保获得单步非负奖励,同时结合随机选取的未来状态作为虚拟目标以促进价值传播;利用截断分位数评论家(TQC)算法更新网络参数以抑制过估计偏差。本发明通过确定性的单步奖励增强了学习信号,显著提高机械臂在推、抓、取放等复杂任务中的控制精度和收敛速度。
外部リソース