CNIPA.AI
Back to Search
Dossier

一种基于在线强化学习的大模型投机推理优化方法及系统

InventionActive
9Claims · 2 independent
§ Ⅰ

Dossier Overview

Inventor

张平; 冯柳源

IPC Classification

G06N 5/04 (2023.01)G06N 3/084 (2023.01)G06N 3/092 (2023.01)

本发明公开了一种基于在线强化学习的大模型投机推理优化方法及系统,所述投机推理优化方法包括:步骤S1:建立原始的大语言模型为目标模型;步骤S2:建立一个参数量小于目标模型的轻量级语言模型,获得草稿模型;步骤S3:比较草稿模型生成的投机词元与目标模型在相同位置生成的词元,进行验证,获得验证结果;步骤S4:基于强化学习框架,根据所述验证结果生成奖励信号,并使用所述奖励信号在线训练更新所述草稿模型的权重。提供一种能够利用在线交互数据,通过强化学习策略持续更新草稿模型的系统及方法,从而动态提升投机预测的准确率,实现更优的推理加速效果。

External Resources