검색으로 돌아가기
기록
分布式强化学习方法、系统及相关设备
발명유효
15청구항 · 5 독립항
§ Ⅰ
개요
발명자
张力; 杨明川; 项超; 李伟
IPC 분류
G06N 3/098 (2023.01)G06N 3/092 (2023.01)G06N 3/0442 (2023.01)G06N 3/0499 (2023.01)G06N 3/0475 (2023.01)G06N 3/045 (2023.01)G06N 3/008 (2023.01)
本公开提供了一种分布式强化学习方法、系统及相关设备,涉及人工智能技术领域。该方法包括:根据分布式系统中各个智能体所处节点的局部状态信息,生成系统状态表征信息,其中,所述局部状态信息包含如下至少之一:环境状态信息、任务进度信息、资源占用信息;根据所述系统状态表征信息,生成动态融合模型的温度参数;基于所述动态融合模型,对各个智能体的局部奖励值进行加权融合,得到全局奖励值,其中,所述温度参数用于调整各个局部奖励值的权重信息;根据所述全局奖励值,更新各个智能体的策略信息,以使各个智能体根据更新后的策略信息生成相应的执行动作。本公开能够增强奖励机制对动态环境的适配能力,使各个智能体作出更优决策。