검색으로 돌아가기
기록
面向强化学习的多轨迹跨状态奖励归因方法
발명유효
9청구항 · 1 독립항
§ Ⅰ
개요
발명자
李峰杰; 程振波; 肖刚; 张侠; 袁牧; 娄振辉; 叶江涛; 江小平
IPC 분류
G06N 3/092 (2023.01)G06N 3/042 (2023.01)G06N 3/0455 (2023.01)G06N 3/048 (2023.01)G06N 3/047 (2023.01)G06N 3/0464 (2023.01)
本发明提出了一种面向强化学习的多轨迹跨状态奖励归因方法,属于强化学习与图神经网络领域。本发明方法在每轮训练过程中,首先采用传统强化学习方法收集环境交互产生的轨迹数据,并按照原有方式计算策略损失和价值函数损失;同时,基于轨迹数据构建全局状态转移图,利用图神经网络计算状态归因概率分布,将每个轨迹最终奖励按归因概率分配到状态节点,获得每个状态节点的奖励归因信号;基于获得的奖励归因信号修改损失函数、修改价值函数及修改奖励信号。通过上述集成方式,本方法不仅能充分利用多条轨迹的信息共享和跨状态奖励归因的优势,还可无缝嵌入主流强化学习训练框架,能够显著提升稀疏与延迟奖励环境下强化学习的训练效果与策略性能。