返回搜索
档案
一种基于大模型自解释的动态路由及其训练方法
发明专利有效
10权利要求 · 2 独立
§ Ⅰ
卷宗概要
发明人
李子龙; 陈奕超; 潘宏兴; 张开; 周夕林
IPC 分类
G06N 5/04 (2023.01)G06N 5/045 (2023.01)G06N 3/045 (2023.01)G06N 3/0495 (2023.01)G06N 3/09 (2023.01)G06N 3/092 (2023.01)G06N 3/096 (2023.01)
本发明涉及一种基于大模型自解释的动态路由及其训练方法,其中训练方法包括冷启动微调阶段:获取经过预训练的基础小参量大语言模型和初始化的LoRA模块,基于合成路由数据集对基础小参量大语言模型进行监督微调训练,得到微调后的LoRA模块;和迭代优化阶段:将基础小参量大语言模型和微调后的LoRA模块合并,得到动态路由模型;基于迭代优化数据集,通过群组相对策略优化算法优化动态路由模型,优化过程中,根据动态路由模型的输出结果匹配下游模块,根据下游模块的输出结果计算群组相对策略优化算法的奖励函数,包括结果正确性奖励函数和格式正确性奖励函数。与现有技术相比,本发明具有可解释性强、路由准确率高等优点。