検索に戻る
案件記録
智能体学习训练方法、装置、计算机设备和存储介质
発明有効
10請求項 · 4 独立
§ Ⅰ
案件概要
発明者
许凯; 倪雨; 秦龙; 曾俊杰; 胡越; 黄鹤松; 曾云秀; 尹路珈; 康夏涛; 李亦韩
IPC分類
G06N 3/092 (2023.01)G06N 3/006 (2023.01)G06F 18/20 (2023.01)
本申请涉及智能体学习训练方法、装置、计算机设备和存储介质,该方法包括:采用LLM模型将高层的意图转换为可执行代码,得到克隆数据集,将智能驾驶场景构建为马尔科夫决策过程并构建指令空间;构建智能体策略模型;将训练目标解耦为行为克隆和强化学习的目标并进行加权求和,根据最终训练目标对智能体进行训练,通过从克隆数据集采样,对智能体策略模型参数进行更新,然后从环境交互轨迹中采样,采用PPO方式对智能体策略模型参数进行更新。由于高层意图‑指令‑策略的链路更接近人类可理解的决策层级,便于对智能体行为进行调试、审计与回溯,从工程落地角度提升可维护性,并为后续接入安全护栏、形式化约束或规则校验提供更清晰的接口。
外部リソース