検索に戻る
案件記録

自适应情感语音生成方法及系统

発明有効
10請求項 · 2 独立
§ Ⅰ

案件概要

発明者

谢振豪; 李建泉; 单锦筠; 韦海; 聂吴楠; 刘耀祺; 王帅; 申胜凡; 蒋峰; 李海洲

IPC分類

G10L 25/63 (2013.01)G10L 25/03 (2013.01)G10L 15/26 (2006.01)G10L 13/02 (2013.01)G10L 25/30 (2013.01)G06F 40/30 (2020.01)

本申请公开了一种自适应情感语音生成方法及系统,其方法实现,包括:获取目标用户的原始音频波形数据,并提取语音情感特征向量;获取回复文本,并进行语义解析与特征提取,生成文本特征序列;对语音情感特征向量与文本特征序列进行跨模态整合,生成融合条件序列;将融合条件序列作为双约束条件,通过预设可逆生成网络,将采样自先验分布的潜在变量映射生成与双约束条件匹配的梅尔频谱图;将梅尔频谱图转换为合成语音波形,得到与目标用户情感状态相匹配的回复音频数据。本实施例,从目标用户原始音频中提取语音情感特征向量,并与回复文本中提取的文本特征序列整合后作为额外条件,生成符合用户情感预期的回复音频,从而实现端到端的情感自适应。

外部リソース