Back to Search
Dossier
基于混合强化学习的智能网络调度方法及系统
InventionActive
2views
10Claims · 3 independent
§ Ⅰ
Dossier Overview
Inventor
程莉; 赵俊; 王程涛; 许楠; 刘欣然; 李璇; 元海文
IPC Classification
H04L 47/62 (2022.01)G06N 3/044 (2023.01)G06N 3/084 (2023.01)G06N 3/092 (2023.01)G06N 3/0985 (2023.01)H04L 47/76 (2022.01)
本发明属于网络调度技术领域,公开了一种基于混合强化学习的智能网络调度方法及系统,本发明设计基于 Transformer 的多头注意力策略网络,能够同时执行离散的协议选择与连续的速率调节,打破了传统调度模型在动作维度划分上的局限。因此,调度器在面对复杂任务时能灵活选择最优策略,显著提升了决策的精细化和适应性。为克服强化学习中价值过估计的问题,本发明构建了双 Q‑Critic 网络结构,引入双重评估路径。在训练过程中通过最小化两个 Critic 的估值偏差,有效抑制了过高估计,从而提高了策略的收敛稳定性和估值精度。在奖励机制上,本发明引入结构因果模型(SCM)生成反事实奖励信号,通过构造针对特定动作的因果干预路径,融合真实奖励与反事实奖励。
External Resources