検索に戻る
案件記録

大语言模型生成有害内容的检测方法及系统

発明有効
10請求項 · 5 独立
§ Ⅰ

案件概要

発明者

江涛; 付文杰; 王寰东; 李勇

IPC分類

G06F 40/295 (2020.01)G06F 40/35 (2020.01)G06F 16/3329 (2025.01)G06F 16/36 (2019.01)G06F 18/214 (2023.01)G06N 5/04 (2023.01)G06N 3/04 (2023.01)G06N 3/0464 (2023.01)G06N 20/10 (2019.01)

本发明公开了一种大语言模型生成有害内容的检测方法及系统,属于信息安全技术领域;本发明构建了一个与大语言模型推理过程并发运行的轻量级监控流程,当大语言模型每输出一个词元时,获取大语言模型中隐藏层L输出的隐藏层特征,以同步捕获其高维度的内部认知表征,并利用有害风险检测模型对该隐藏层特征进行分析,以判断是否存在有害风险;在此基础上,考虑到单个词元的生成意图可能存在瞬时波动,引入词元窗口对连续的检测结果进行平滑处理,只有当词元窗口满足有害条件时才判定当前存在有害内容,能够在大语言模型每生成一个词元时及时地对所生成的内容是否有害进行准确检测,解决了现有技术中与用户交互时存在显著的回复延迟的技术问题。

外部リソース