CNIPA.AI
Back to Search
Dossier

一种大模型后门攻击检测与自动溯源方法

InventionActive
10Claims · 1 independent
§ Ⅰ

Dossier Overview

Inventor

牛犁青; 柯爽; 梅杰

IPC Classification

G06F 21/56 (2013.01)G06F 21/55 (2013.01)G06F 18/23 (2023.01)G06F 18/214 (2023.01)G06N 5/04 (2023.01)G06N 3/094 (2023.01)

本发明提供一种大模型后门攻击检测与自动溯源方法,旨在解决现有技术中在大规模预训练模型后门攻击检测中的准确性差、误报率高及隐蔽后门识别困难的问题。该方法首先通过提取目标大模型的参数分布特征和推理行为特征,利用聚类分析识别潜在的异常聚类。接着,通过分析模型输出的偏差与生成对抗样本来验证模型是否受到后门攻击影响,并通过特征反演回溯技术,追踪输入与输出之间的映射关系,定位后门触发器特征。最后,通过溯源分析,识别后门攻击源及其传播路径,并通过修正异常参数与重训练来消除后门影响。该方法具有高效、低误报、自动溯源等优点,能够有效提高大规模模型的安全性,确保模型在实际应用中的可信度和可靠性。

External Resources