CNIPA.AI
返回搜索
档案

一种基于文化旅游场景的大模型训练方法

发明专利有效
10权利要求 · 1 独立
§ Ⅰ

卷宗概要

发明人

王灿进; 仇应俊; 龚陆凯; 顾炼

IPC 分类

G06N 5/022 (2023.01)G06N 5/04 (2023.01)G06Q 50/14 (2012.01)G06N 3/045 (2023.01)G06N 3/092 (2023.01)G06F 18/21 (2023.01)

本申请公开了一种基于文化旅游场景的大模型训练方法,具体实现方案为:从数据库中提取垂直语料,构建初始数据集,从初始数据集中提取实体、关系,构建文旅知识图谱;基于人工标注和文旅知识图谱生成问答对,将问答对输入至奖励模型RM输出质量评分,实现对奖励模型RM的初始化训练;利用知识校验大模型提升问答对的交互,形成新问答对;利用完成初始化训练的奖励模型RM对新问答对进行评分,过滤低分样本,将过滤后得到的高分样本作为强化学习的训练样本;使用强化学习的训练样本对微调奖励模型RM,并基于KL散度更新奖励模型RM参数。本申请能够提升模型在文旅场景中的专业度;提升模型对模糊输入的语义解析与多轮引导能力;平衡新旧知识融合。