返回搜索
档案
基于多人语音驱动的视频生成方法、装置、设备和介质
发明专利有效
10权利要求 · 4 独立
§ Ⅰ
卷宗概要
发明人
马兴沛; 蔡佳然; 黄深能; 张顺四
IPC 分类
H04N 21/854 (2011.01)H04N 21/2343 (2011.01)H04N 21/44 (2011.01)H04N 21/4402 (2011.01)H04N 21/81 (2011.01)H04N 21/845 (2011.01)
本发明公开了一种基于多人语音驱动的视频生成方法、装置、设备和介质,方法包括通过获取待处理多人图像、音频条件集和噪声特征;对待处理多人图像进行区域分割,确定多个掩码区域;建立音频条件集内各音频条件与各掩码区域之间的关联关系;调用预训练的视频生成扩散模型根据各音频条件和关联关系,对噪声特征进行批量迭代去噪,生成目标图像序列;采用目标图像序列和音频条件集进行视频编码,生成目标视频并输出。通过区域分割引入掩码区域的方式,在无需对视频生成扩散模型进行重训练的情况下,灵活适配不同角色数量下的视频生成。