CNIPA.AI
검색으로 돌아가기
기록

基于重复词分析的大型语言模型后门攻击检测与防御方法及装置

발명유효
1조회수
10청구항 · 2 독립항
§ Ⅰ

개요

발명자

张川; 陶肖龙; 祝烈煌; 高铮

IPC 분류

G06F 21/55 (2013.01)G06F 21/56 (2013.01)G06F 18/2113 (2023.01)G06F 18/22 (2023.01)G06F 18/21 (2023.01)G06F 40/289 (2020.01)G06F 40/30 (2020.01)G06N 5/04 (2023.01)G06N 3/045 (2023.01)G06N 3/0475 (2023.01)G06N 3/094 (2023.01)

本发明属于人工智能技术领域,具体涉及基于重复词分析的大型语言模型后门攻击检测与防御方法及装置,具体过程为:后门攻击检测:首先,针对输入文本的统计特征、测量模型输出行为和文本内容进行潜在可疑输入文本初步筛选;其次,利用扰动设置或构造“对抗组”方式,对潜在可疑输入文本进行触发器验证;最后,通过递归优化机制进一步挖掘隐藏触发器;触发器屏蔽:首先,利用注意力机制评估各触发器在检测模型中的重要性,识别出影响模型决策的触发器;其次,通过替换或扰动输入文本中的触发器,实现触发器的屏蔽,最后,评估触发器屏蔽对模型性能影响,当测量模型输出质量被影响,则进行进一步屏蔽优化。