検索に戻る
案件記録

面向大语言模型推理服务的预测性智能扩缩容方法及相关设备

発明有効
10請求項 · 5 独立
§ Ⅰ

案件概要

発明者

朱天琦; 蒋仕龙

IPC分類

G06F 9/50 (2006.01)G06F 11/30 (2006.01)G06N 5/04 (2023.01)G06N 20/00 (2019.01)

本申请提供一种面向大语言模型推理服务的预测性智能扩缩容方法及相关设备,方法包括:基于历史监控数据中对应历史时间段的GPU缓存利用率计算得到第一实例需求数量;获取运行于计算集群中的大语言模型推理服务的实时GPU缓存利用率,并按照预设第二目标利用率计算得到第二实例需求数量;将第一实例需求数量与第二实例需求数量进行融合,得到扩缩容预测实例数量;对扩缩容预测实例数量进行边界约束,以限定在预设的最小实例数与最大实例数之间,得到目标实例数量;基于目标实例数量与当前运行实例数量的比较结果执行扩缩容操作。本申请引入历史监控数据与实时监控数据的双路预测融合机制,显著提高了大语言模型推理服务的响应速度与稳定性。

外部リソース