검색으로 돌아가기
기록
大语言模型服务的资源处理方法、装置、设备及存储介质
발명유효
10청구항 · 4 독립항
§ Ⅰ
개요
발명자
郭嵩; 刘千里
IPC 분류
G06F 9/50 (2006.01)G06N 5/04 (2023.01)
本申请公开了一种大语言模型服务的资源处理方法、装置、设备及存储介质,通过检测大语言模型服务中各服务请求的请求状态及其所需的缓存大小,并据此进行动态资源调度。具体地,对于新增状态的请求,根据其所需缓存大小建立缓存分配任务;对于完成状态的请求,根据其占用的缓存资源建立缓存释放任务;对于运行中状态且所需缓存大小发生变更的请求,则建立对应的缓存更新任务;系统根据这些缓存分配任务、缓存释放任务和缓存更新任务,对大语言模型服务的缓存资源进行统一调度,以优化内存资源的使用。本申请可实现对大语言模型服务的缓存资源的高效与灵活管理,从而提高缓存资源的利用效率。本申请的技术方案可广泛应用于人工智能技术领域。