CNIPA.AI
검색으로 돌아가기
기록

一种基于强化学习的大模型持续学习训练方法

발명유효
10조회수
7청구항 · 1 독립항
§ Ⅰ

개요

발명자

刘楼楼; 赵振; 邓淼

IPC 분류

G06N 5/04 (2023.01)G06N 3/092 (2023.01)G06F 18/25 (2023.01)

本发明公开了一种基于强化学习的大模型持续学习训练方法,包括:通过CLB模块替换传统路由模块中的全连接模块,CLB模块通过LinUCB算法模型将抽象的专家能力转化为可计算的置信度量;引入异常检测机制,检测LinUCB算法模型训练过程中是否有噪声数据或异常梯度引发的参数漂移;若有,则将CLB模块中的置信空间参数回退至历史稳定状态,并利用动量系数融合历史梯度与当前梯度,重构置信空间参数,平滑当前波动;通过加权平均历史梯度方向,抑制置信空间参数更新中的高频震荡;重置异常计数器,重新进入正常训练流程,动态地选择最合适的专家进行处理数据。本发明解决了MoE架构大模型在训练过程中因黑盒特性、噪声干扰及持续学习能力不足的问题。