CNIPA.AI
검색으로 돌아가기
기록

一种基于大模型自解释的动态路由及其训练方法

발명유효
1조회수
10청구항 · 2 독립항
§ Ⅰ

개요

발명자

李子龙; 陈奕超; 潘宏兴; 张开; 周夕林

IPC 분류

G06N 5/04 (2023.01)G06N 5/045 (2023.01)G06N 3/045 (2023.01)G06N 3/0495 (2023.01)G06N 3/09 (2023.01)G06N 3/092 (2023.01)G06N 3/096 (2023.01)

本发明涉及一种基于大模型自解释的动态路由及其训练方法,其中训练方法包括冷启动微调阶段:获取经过预训练的基础小参量大语言模型和初始化的LoRA模块,基于合成路由数据集对基础小参量大语言模型进行监督微调训练,得到微调后的LoRA模块;和迭代优化阶段:将基础小参量大语言模型和微调后的LoRA模块合并,得到动态路由模型;基于迭代优化数据集,通过群组相对策略优化算法优化动态路由模型,优化过程中,根据动态路由模型的输出结果匹配下游模块,根据下游模块的输出结果计算群组相对策略优化算法的奖励函数,包括结果正确性奖励函数和格式正确性奖励函数。与现有技术相比,本发明具有可解释性强、路由准确率高等优点。