検索に戻る
案件記録
一种多模型推理的模型切换方法
発明有効
10請求項 · 4 独立
§ Ⅰ
案件概要
発明者
丁杭超; 谢家齐; 唐华云; 伍冠宇; 贾晨; 宗瓒; 黄鑫玉; 王延昭; 闻立杰
IPC分類
G06F 9/445 (2018.01)G06F 9/50 (2006.01)G06N 5/04 (2023.01)
本发明涉及大模型推理技术领域,公开一种多模型推理的模型切换方法,本发明通过引入以层为粒度的模型切分与动态换入换出机制,结合支持多实例并发执行的多模型管理器及负载感知智能调度算法,有效解决资源受限环境下多模型部署的难题。本发明能够显著降低模型切换延迟,实现多模型的真正并发推理,并能根据实时负载动态优化资源分配,从而在有限GPU显存条件下,大幅提升系统吞吐量、降低平均响应时间,为在算力受限场景中高效运行多个大模型提供可行的解决方案。
外部リソース