検索に戻る
案件記録

一种黑盒场景下的大语言模型生成内容安全测试系统及方法

発明有効
10請求項 · 2 独立
§ Ⅰ

案件概要

出願人

中国电子科技网络信息安全有限公司; 中国电子科技集团公司第三十研究所

発明者

王德胜; 孙治; 廖珊; 王一凡; 万郅玙; 熊坤; 马浩涵; 张玲

IPC分類

G06F 40/284 (2020.01)G06F 40/211 (2020.01)G06F 40/30 (2020.01)G06F 16/35 (2025.01)G06F 16/334 (2025.01)G06F 18/214 (2023.01)G06F 18/241 (2023.01)G06F 16/3329 (2025.01)G06N 3/126 (2023.01)

本申请公开了一种黑盒场景下的大语言模型生成内容安全测试系统及方法,该系统包括:越狱提示词库模块用于存储对大语言模型进行安全性测试的越狱提示词;违规问答对模块用于存储涵盖不同类型的违规问答对;响应采集模块用于根据越狱提示词和查询请求构成的查询内容得到数据请求包;安全分析模块用于计算查询请求对应的响应数据与期望的违规回答之间的相似度,并将相似度作为安全性评分,将安全性评分输入自适应优化模块;自适应优化模块用于根据安全分析模块输出的安全性评分,使用遗传算法优化越狱提示词库模块输出的越狱提示词。本申请能够有效地对大语言模型生成内容的安全性进行测试。

外部リソース