검색으로 돌아가기
기록
基于强化学习的数据流任务调度与资源自适应分配方法
발명유효
9청구항 · 1 독립항
§ Ⅰ
개요
발명자
曹志远; 闫娇娇
IPC 분류
G06F 9/48 (2006.01)G06F 9/50 (2006.01)G06N 3/045 (2023.01)G06N 3/092 (2023.01)G06N 3/098 (2023.01)
本发明公开了基于强化学习的数据流任务调度与资源自适应分配方法,包括如下步骤:采集数据,形成环境状态向量;基于所述状态向量构成动作集合;确定回报区间并离散为若干原子支持点,形成离散回报支持集合;构建决策网络,并采用Categorical DQN进行分布建模与训练;在训练中基于经验回放缓冲区按时延大小优先采样形成批次,在动作选择时对延迟分布与能耗分布加权合成综合回报以确定最优动作;在调度执行时依据所述分布计算期望回报并选择动作;在执行后生成奖励写入缓冲区,持续更新决策网络。本发明引入多目标分布建模与延迟优先经验回放,实现企业数据流任务的延迟能耗兼顾与资源自适应调度。