返回搜索
档案
基于直接偏好优化的语音合成方法、装置、设备及介质
发明专利有效
10权利要求 · 4 独立
§ Ⅰ
卷宗概要
发明人
陈闽川; 万臣臣; 王少军
IPC 分类
G10L 13/02 (2013.01)G10L 13/04 (2013.01)G10L 13/08 (2013.01)G06F 18/10 (2023.01)G06F 18/22 (2023.01)G06F 18/214 (2023.01)G06F 18/25 (2023.01)
本发明涉及人工智能技术领域,可应用于金融科技和医疗科技领域,公开了一种基于直接偏好优化的语音合成方法、装置、设备及介质,该方法先获取预训练流匹配语音合成模型作为初始模型,将其常微分方程采样过程转换为含每积分步骤引入随机噪声的等效随机微分方程采样过程,得到随机化模型;再获取输入文本及对应参考语音,输入随机化模型输出多个候选语音样本;通过预设评分策略评分筛选出偏好样本与非偏好样本,构建偏好数据对;基于直接偏好优化算法,用偏好数据对训练两个待训练随机化模型,得到偏好模型与非偏好模型;最后接收待合成文本,经两模型合成输出结果并融合,得到目标语音。通过偏好数据引导模型优化,显著地提升了语音合成质量。