검색으로 돌아가기
기록
一种基于强化学习的海上作战杀伤网自动生成方法
발명유효
10청구항 · 1 독립항
§ Ⅰ
개요
발명자
马汝辉; 韩学远; 袁小松; 蔡子诺
IPC 분류
G06F 18/20 (2023.01)G06F 18/2411 (2023.01)G06F 18/214 (2023.01)
本发明公开了一种基于强化学习的海上作战杀伤网自动生成方法,涉及杀伤网领域,包括:获取多个作战任务的需求数据及多个作战平台的资源数据;基于当前系统状态和硬约束条件生成合法动作集合;利用预训练的强化学习模型对合法动作集合内的动作进行评分,选择评分最高的动作作为杀伤网资源分配决策;执行杀伤网资源分配决策,更新战场状态;在强化学习模型的评估阶段,若检测到模型权重不可用,则自动切换至基于即时收益的贪心回退策略进行决策,并输出与模型决策格式一致的分配结果清单。本发明通过构建动态合法动作集、设计分解式奖励及引入贪心回退机制,在大规模、强约束的场景下能稳定训练与推理,显著提升了杀伤网规划的效率和可靠性。