検索に戻る
案件記録
基于强化学习的科技情报智能体训练方法及系统
発明有効
10請求項 · 3 独立
§ Ⅰ
案件概要
発明者
吴素研; 侯元元; 戴爱兵; 李瑛; 廖金花; 吕志坚
IPC分類
G06N 3/006 (2023.01)G06N 20/00 (2019.01)G06N 3/092 (2023.01)G06F 40/284 (2020.01)G06F 40/216 (2020.01)G06F 40/247 (2020.01)
本发明提供一种基于强化学习的科技情报智能体训练方法及系统,涉及强化学习技术领域,首先确定科技情报智能体训练对应的包含初始探索、深度分析和结果输出阶段属性的情报任务多阶段演进特征,构建与之适配且含各阶段行为可选集及阶段转换条件的强化学习探索空间,接着生成适配该强化学习探索空间的阶段性情报样本簇,调用智能体在探索空间中按阶段与样本簇交互形成跨阶段行为序列,然后基于多阶段演进特征构建多阶段奖励函数,依据跨阶段行为序列生成阶段奖励信号并更新智能体决策参数,完成单次训练迭代,有效提升了智能体在多阶段科技情报任务环境下的处理能力。
外部リソース