CNIPA.AI
검색으로 돌아가기
기록

一种增强llama.cpp框架的大模型部署方法

발명유효
1조회수
10청구항 · 3 독립항
§ Ⅰ

개요

발명자

许小东; 黄禺冠; 肖馨艺; 秦晓卫

IPC 분류

G06N 3/10 (2006.01)G06F 8/60 (2018.01)G06F 9/50 (2006.01)G06N 3/045 (2023.01)

本发明公开了一种增强llama.cpp框架的大模型部署方法,属于大语言模型推理优化技术领域。所述方法包括:首先,增强llama.cpp框架以支持算子级的张量设备分配;其次,构建一个以模型吞吐量最大化为目标的0‑1整数线性规划模型,该模型定义了算子分配、整层分配及算子内聚性三类决策变量,并设置了单算子分配、设备资源容量及分配顺序等约束条件;最后,采用分支定界法求解该规划问题,得到最优的算子级资源分配方案,并依据该方案将模型各算子部署到GPU或CPU上。本发明能够精细化管理设备显存与内存,优先将对吞吐量影响大的算子部署于GPU,从而在资源有限条件下显著提升大模型的推理吞吐量和显存利用率。