검색으로 돌아가기
기록
一种基于强化学习的轮胎装箱决策优化方法及系统
발명유효
1조회수
10청구항 · 2 독립항
§ Ⅰ
개요
발명자
何桂霞; 邱紫萌; 鲁建厦; 袁俊; 马建平; 戚金; 蔡啸
IPC 분류
G06F 30/27 (2020.01)G06N 3/042 (2023.01)G06N 3/0464 (2023.01)G06N 3/092 (2023.01)
本发明涉及一种基于强化学习的轮胎装箱决策优化方法及系统。方法包括:构建马尔可夫决策过程模型,并定义状态空间、动作空间和奖励函数;生成候选放置动作,对箱体高度图中不同高度层进行连通区域提取,获取各层轮廓信息,选取轮廓凸顶点作为候选放置位置,并构成候选动作集合;构建多模态策略网络,生成放置策略;输出各候选动作的价值估计,选择价值最高的动作作为当前放置决策;采用分布式训练框架对多模态策略网络进行训练,通过多进程并行环境交互和优先经验回放优化网络参数;部署训练完成的多模态策略网络,实时输出轮胎放置的决策结果。该方法可以在状态空间中精确描述刚性轮胎的形态特征,增强轮胎几何形状适应性。