검색으로 돌아가기
기록
语音驱动视频生成方法、装置、设备和存储介质
발명유효
14청구항 · 4 독립항
§ Ⅰ
개요
발명자
张继业; 许俐; 廖桂标; 刘丁玮
IPC 분류
H04N 21/234 (2011.01)H04N 21/44 (2011.01)G10L 19/00 (2013.01)G10L 19/008 (2013.01)
本申请实施例提供语音驱动视频生成方法、装置、设备和存储介质,涉及显示技术领域。对语音数据进行编码得到跨模态特征张量,对跨模态特征张量进行时空注意力对齐得到多个时间步分别对应的网络偏移量,基于中性网格和网络偏移量生成每个时间步分别对应的关键点数据,对目标图像进行编码得到潜在特征向量,根据关键点序列和噪声数据生成动作初始数据,至少将动作初始数据和潜在特征向量输入迭代去噪网络进行协同注意力处理得到记忆特征,对记忆特征进行解码得到每个时间步对应的生成图像。利用协同注意力机制动态聚焦语音、图像、动作三者的关联信息,通过迭代去噪逐步优化动作细节,减少噪声对生成结果的干扰,提升语音驱动视频生成的准确性。