検索に戻る
案件記録

一种大模型分布式训练中的GPU检查点保存方法

発明有効
2閲覧数
10請求項 · 3 独立
§ Ⅰ

案件概要

発明者

王宏路; 李莞坡; 徐鹤; 郭麒麟; 王汝传; 李鹏; 季一木

IPC分類

G06F 11/07 (2006.01)G06N 3/098 (2023.01)G06N 3/084 (2023.01)

本发明是一种大模型分布式训练中的GPU检查点保存方法,包括步骤1:训练开始时,加载检查点配置信息;步骤2:在训练过程中监听各层的反向传播完成信号,当某一层完成参数更新后,立即触发该层的检查点分片保存操作;步骤3:将该层的模型状态从GPU内存异步复制到CPU内存中,并进行一致性校验;步骤4:将检查点分片从CPU内存异步保存到持久化存储中;步骤5:当需要恢复训练时,从持久化存储中加载检查点文件,进行完整性验证,并将各层分片数据重新合并为完整模型状态,恢复训练.本发明通过在反向传播阶段及时触发检查点分片保存,并与其他训练操作并行执行,减少了训练过程中检查点的同步阻塞和I/O瓶颈,从而提高了训练效率,缩短了故障恢复时间。

外部リソース