CNIPA.AI
返回搜索
档案

一种类别自适应强化学习的大模型安全加固方法及系统

发明专利有效
10权利要求 · 2 独立
§ Ⅰ

卷宗概要

发明人

骆妲; 孙治; 王一凡; 廖珊; 熊坤; 张玲; 饶志宏

IPC 分类

G06F 21/52 (2013.01)G06F 21/55 (2013.01)G06F 21/71 (2013.01)G06N 3/092 (2023.01)G06N 5/04 (2023.01)

本申请公开了一种类别自适应强化学习的大模型安全加固方法及系统,该方法包括:将从大模型安全评测系统获取的安全风险数据划分为多个安全类别,通过辅助生成大语言模型生成对应的安全响应,构建各安全类别的训练数据集;通过对比原始大模型回答与各安全类别的训练数据集中的安全响应,构建损失函数,通过最小化该损失函数训练对应的奖励模型;基于各安全类别对应的奖励模型及其奖励缩放因子,得到优势函数;以优势函数为基础构建整体目标函数,在大模型训练过程中交替迭代优化各安全类别的目标函数,使策略模型能够同时学习并对齐多安全类别的安全偏好,最终得到经多安全类别联合优化的大模型。本申请增强了模型的安全性与鲁棒性。