CNIPA.AI
검색으로 돌아가기
기록

一种恶意数据合成方法、装置及设备

발명유효
1조회수
11청구항 · 3 독립항
§ Ⅰ

개요

발명자

王兴科; 陈龙; 熊嘉歆; 陈瑛

IPC 분류

G06F 18/214 (2023.01)G06F 18/22 (2023.01)G06N 5/04 (2023.01)G06N 3/0455 (2023.01)G06N 3/045 (2023.01)G06N 3/0499 (2023.01)

本申请公开了一种恶意数据合成方法、装置及设备,该方法包括:针对目标大模型的每层,分别确定衡量正常请求样本对应的层输出表征间相似性的类内相似度,和衡量正常请求样本与恶意请求样本对应的层输出表征间相似性的类间相似度;基于类内相似度与类间相似度的差异随层深度的变化趋势,确定对齐行为发生的目标层区域;利用针对目标层区域生成的多个候选扰动信息调整目标大模型中的对应层参数,得到多个候选大模型,并从多个候选大模型中,筛选出可高效合成恶意数据的目标对齐抑制模型。本申请无需重训模型,通过定位对齐区域实现对模型对齐机制的定向抑制,从而利用被抑制的模型高效地生成高质量恶意数据。