検索に戻る
案件記録

一种增强llama.cpp框架的大模型部署方法

発明有効
3閲覧数
10請求項 · 3 独立
§ Ⅰ

案件概要

発明者

许小东; 黄禺冠; 肖馨艺; 秦晓卫

IPC分類

G06N 3/10 (2006.01)G06F 8/60 (2018.01)G06F 9/50 (2006.01)G06N 3/045 (2023.01)

本发明公开了一种增强llama.cpp框架的大模型部署方法,属于大语言模型推理优化技术领域。所述方法包括:首先,增强llama.cpp框架以支持算子级的张量设备分配;其次,构建一个以模型吞吐量最大化为目标的0‑1整数线性规划模型,该模型定义了算子分配、整层分配及算子内聚性三类决策变量,并设置了单算子分配、设备资源容量及分配顺序等约束条件;最后,采用分支定界法求解该规划问题,得到最优的算子级资源分配方案,并依据该方案将模型各算子部署到GPU或CPU上。本发明能够精细化管理设备显存与内存,优先将对吞吐量影响大的算子部署于GPU,从而在资源有限条件下显著提升大模型的推理吞吐量和显存利用率。

外部リソース