検索に戻る
案件記録

一种基于自博弈范式的模型训练方法、装置和设备

発明有効
12請求項 · 4 独立
§ Ⅰ

案件概要

発明者

范钊瑀; 洪海文; 黄龙涛

IPC分類

G06F 18/214 (2023.01)G06F 16/3329 (2025.01)G06N 5/04 (2023.01)G06N 3/045 (2023.01)G06N 3/0475 (2023.01)G06N 3/084 (2023.01)G06N 3/094 (2023.01)

本发明实施例公开了一种基于自博弈范式的模型训练方法、装置和设备。本发明实施例中,通过获取设定领域的问答对数据集;将问答对数据集输入到第一大语言模型中,确定第一大语言模型中设定隐藏层的隐藏状态表示以及第一目标答案;将隐藏状态表示发送至第二大语言模型中的设定隐藏层,确定第二目标答案;根据第一目标答案和标准答案生成基础损失函数,并根据第二目标答案和标准答案生成困惑损失函数;根据基础损失函数和困惑损失函数生成第一总损失函数;根据第一总损失函数更新第一大语言模型的参数。通过上述方法,可以在不同业务场景下,将不同的领域知识快捷且准确的注入大语言模型,实现大语言模型的高效训练。

外部リソース