검색으로 돌아가기
기록
基于vGPU性能干扰感知的大模型推理负载资源配置方法
발명유효
1조회수
9청구항 · 3 독립항
§ Ⅰ
개요
출원인
山东省计算中心(国家超级计算济南中心); 齐鲁工业大学(山东省科学院)
발명자
张虎; 阎鑫; 王英龙; 郭莹; 赵大伟; 王继彬; 陈静; 王迪; 葛菁; 蔡斌雷
IPC 분류
G06F 9/50 (2006.01)G06N 5/04 (2023.01)
本发明涉及基于vGPU性能干扰感知的大模型推理负载资源配置方法,包括:给定一组大模型推理负载,以及它们允许的最大首Token响应时间TTFT、最大平均单Token生成时间TPOT和请求到达率;得到推理负载所需物理GPU,计算运行推理负载所需的vGPU资源占物理GPU的最小比例;作为初始分配基准;根据vGPU资源需求对大模型推理负载进行降序排序;对于每个待分配负载,遍历现有候选GPU设备,在保证当前物理GPU已分配的资源不超过其最大容量的前提下,通过迭代调整机制动态分配资源;若现有设备无法容纳新负载,则扩展新的GPU设备。本发明可以准确评估推理任务所需的vGPU资源规模。