検索に戻る
案件記録
基于Hadamard分解低秩量化的大语言模型压缩方法、系统和装置
発明有効
12請求項 · 3 独立
§ Ⅰ
案件概要
発明者
吴剑秋; 卢俊
IPC分類
G06N 3/0495 (2023.01)G06N 3/045 (2023.01)G06N 3/0464 (2023.01)G06N 3/084 (2023.01)G06N 5/04 (2023.01)
本发明公开了基于Hadamard分解低秩量化的大语言模型压缩方法、系统和装置,用于提升大语言模型推理效率,降低显存占用和计算成本,方法包括:对后训练数据进行随机采样;对模型的参数矩阵进行低秩分解得到低秩矩阵;对低秩矩阵分别进行GPTQ量化和Hessian逆矩阵量化得到参数矩阵的低秩量化逼近;通过交替梯度下降Hadamard分解和量化对原参数与其低秩量化逼近的差进行逼近与量化,得到偏差低秩量化逼近;将参数矩阵的低秩量化逼近和偏差低秩量化逼近相加替换原模型参数,并在后训练数据集上进行训练,得到训练好的压缩模型。本发明系统采用适用于云端推理、边缘计算及智能客服、金融、政务、医疗、教育等行业场景。
外部リソース