검색으로 돌아가기
기록
一种基于动态去噪分类器的偏好强化学习鲁棒性提升方法
발명유효
1조회수
10청구항 · 2 독립항
§ Ⅰ
개요
발명자
许一; 熊健; 罗旺
IPC 분류
G06N 3/092 (2023.01)G06N 3/09 (2023.01)G06N 3/084 (2023.01)G06N 3/048 (2023.01)G06N 3/0464 (2023.01)
本发明公开了一种基于动态去噪分类器的偏好强化学习鲁棒性提升方法,涉及人工智能与机器学习技术领域。本发明包括:构建动态去噪奖励模型,所述动态去噪奖励模型包括基础奖励预测器和动态去噪分类器;从偏好数据集中采样训练数据,将训练数据输入基础奖励预测器和动态去噪分类器进行协同训练;将训练好的动态去噪奖励模型中的基础奖励预测器作为奖励函数,集成到强化学习算法中以优化智能体的策略网络。本发明创新性地构建了包含基础奖励预测器和动态去噪分类器的双分支网络模型,通过协同训练机制实现噪声标签的动态识别与抑制,并采用多阶段动态阈值调整策略,结合自适应学习率调度和渐进式批量训练,有效提升了模型对噪声数据的免疫力。