CNIPA.AI
검색으로 돌아가기
기록

一种结合奖励模型的大模型路由方法及装置

발명유효
10청구항 · 5 독립항
§ Ⅰ

개요

발명자

方帅; 严衎; 徐秀云; 许冰玉; 徐莹; 谢莹; 刘彬

IPC 분류

G06N 5/04 (2023.01)G06N 3/096 (2023.01)G06F 9/50 (2006.01)

本发明提出一种结合奖励模型的大模型路由方法及装置,涉及人工智能模型动态路由技术领域,其中,方法包括:获取用户输入的问题,并根据用户权限和预设的优先规则确定候选模型集合;通过敏感检测模型对所述问题进行敏感信息判断,若检测到敏感信息则直接返回预设答案,否则进入下一步;基于路由函数对所述候选模型集合中的各模型进行奖励评估,所述路由函数通过知识蒸馏技术训练,以KL散度作为损失函数优化模型选择策略;根据所述路由函数的评估结果,将所述问题动态分发至奖励值最高的目标模型进行推理,并输出所述目标模型的处理结果。本发明能够有效降低大模型集成的计算开销,提升路由决策的智能化水平,显著提高系统资源利用率和响应效率。