検索に戻る
案件記録

基于偏好树的开放域过程奖励模型构建方法及装置

発明有効
10請求項 · 5 独立
§ Ⅰ

案件概要

発明者

张开颜; 华尔默; 吕兴泰; 丁宁; 周伯文

IPC分類

G06F 16/3329 (2025.01)G06F 16/335 (2019.01)G06N 5/04 (2023.01)

本申请涉及一种基于偏好树的开放域过程奖励模型构建方法及装置,其中,方法包括:通过利用现有的结果式奖励模型,结合并行采样和句子聚合策略,构建过程偏好树;将结果式奖励模型的结果级奖励回传到过程级、在关键分歧步骤施加强化监督的联合建模机制,以从理论与实践上降低过程监督的累积误差。由此,解决了现有技术无法在开放域低成本、可扩展地获得过程级监督,也难以使其与结果级评价协同等问题。

外部リソース