CNIPA.AI
검색으로 돌아가기
기록

基于强化学习的异构智能体协同决策方法及相关设备

발명유효
10청구항 · 3 독립항
§ Ⅰ

개요

발명자

兰旭光; 卢旭阳; 万里鹏; 陈卓然; 马俊杰

IPC 분류

G05D 1/46 (2024.01)G05D 1/644 (2024.01)G05D 1/648 (2024.01)G05D 109/20 (2024.01)

本发明涉及了智能体控制技术领域,具体涉及了基于强化学习的异构智能体协同决策方法及相关设备,方法为基于涵盖空间观测层、决策控制层与执行仿真层跨域多Domain‑Dynamic环境,进行卫星观测,其中,高轨卫星执行目标区域搜索与初始探测,低轨卫星基于高轨结果进行局部强化观测及目标定位,二者采用不同强化学习算法学习观测策略。通过双触发任务机制调度卫星观测结果,经时延补偿后传输至决策控制层。决策控制层基于强化智能体生成避障决策并输出控制指令。执行仿真层接收指令驱动飞行器运动,实现动态避障。该系统通过三域协同闭环机制,有效解决复杂空间环境中信息受限、态势估计精度不足及策略收敛困难等问题,提升飞行器自主避障能力。