검색으로 돌아가기
기록
基于深度强化学习的供应链智能协同调度系统及方法
발명유효
1조회수
9청구항 · 2 독립항
§ Ⅰ
개요
발명자
唐桠楠; 孙建豪; 张国宝
IPC 분류
G06Q 10/087 (2023.01)G06Q 10/0631 (2023.01)G06Q 10/0635 (2023.01)G06Q 10/0639 (2023.01)G06F 18/214 (2023.01)G06F 18/25 (2023.01)G06N 3/092 (2023.01)
本发明公开了基于深度强化学习的供应链智能协同调度系统及方法,包括如下步骤:采集订单、库存、运输及产能等多源数据构建状态张量,利用C51算法对各节点智能体的可选调度动作进行分布式回报建模,输出动作回报分布向量,基于回报分布提取风险指标,生成风险表达张量,将状态张量与风险表达张量输入MADDPG架构构建的多智能体集中评估网络,评估联合策略的集中值函数,通过策略融合生成统一的联合策略动作向量,产出调度指令并驱动各节点执行,执行结果反馈用于策略更新与循环迭代。本发明融合C51算法与MADDPG架构实现多节点联合调度优化。