CNIPA.AI
검색으로 돌아가기
기록

一种基于强化学习的推理大模型优化方法

발명유효
9청구항 · 2 독립항
§ Ⅰ

개요

발명자

尤志强; 任星宇; 王仿; 宋健

IPC 분류

G06N 5/04 (2023.01)G06N 3/092 (2023.01)G06N 3/0442 (2023.01)G06N 20/00 (2019.01)

本发明涉及推理大模型技术领域,尤其涉及一种基于强化学习的推理大模型优化方法;通过引入分阶段的、动态调整的文本擦除策略与基于正确性变化的思考质量奖励机制,显著提升了大模型思考过程的质量与效率,该方法通过在多个训练阶段中系统性地对模型生成的思考文本进行局部或全局的随机擦除,并观察擦除前后答案正确性的变化来量化思考文本中每个部分的重要性,从而引导模型在训练中学会生成更加精炼、关键信息密集且冗余度低的思考内容,使得模型在保持高准确性的同时,大幅降低了生成思考文本所需的计算开销与时间成本;解决了现有的推理大模型在训练过程中对思考质量难以有更好的控制,容易产生较多无效思考的技术问题。