CNIPA.AI
검색으로 돌아가기
기록

大语言模型的提示词攻击检测方法、系统及电子设备

발명유효
10청구항 · 3 독립항
§ Ⅰ

개요

발명자

冯德明; 张震宇; 徐兵兵

IPC 분류

G06F 21/55 (2013.01)G06F 40/166 (2020.01)G06F 40/205 (2020.01)G06F 40/226 (2020.01)G06F 40/30 (2020.01)G06N 3/0455 (2023.01)G06N 3/08 (2023.01)

本发明提供了一种大语言模型的提示词攻击检测方法、系统及电子设备,涉及文本处理技术领域,该方法包括:确定原始文本中待处理的文本块;对文本块进行启发式的语义解析,得到第一可疑文本块及其第一风险评分;通过第一语言模型,对第一可疑文本块及其上下文信息进行语义分析,得到第二可疑文本块及其第二风险评分;通过第二语言模型,根据预设的元提示词对第二可疑文本块进行攻击意图的结构化验证,得到攻击意图验证结果;该攻击意图验证结果包括:第三可疑文本块及其第三风险评分;基于第一风险评分、第二风险评分和第三风险评分,对原始文本执行目标响应动作。本发明既能够兼顾长文本的高效处理需求,又能够提高对复杂攻击的检测准确性。