CNIPA.AI
返回搜索
档案

一种多源运动融合的说话人视频生成系统及方法

发明专利有效
7权利要求 · 2 独立
§ Ⅰ

卷宗概要

发明人

江奎; 刘诗宇; 江俊君; 查志远; 姚鸿勋

IPC 分类

H04N 21/854 (2011.01)H04N 21/81 (2011.01)G06T 13/20 (2011.01)G06T 13/80 (2011.01)G06N 3/0442 (2023.01)G06N 3/0455 (2023.01)G06N 3/0475 (2023.01)G06N 3/092 (2023.01)G06N 3/094 (2023.01)G06F 18/25 (2023.01)

本发明提出一种多源运动融合的说话人视频生成系统及方法,属于视频生成技术领域本发明为解决传统说话人视频生成中存在唇部抖动和运动模糊的问题,其中系统包括:输入处理与静态建模模块、声韵运动转换模块、多源自适应融合模块和动态渲染与合成模块。方法包括:通过输入处理与静态建模模块建立人物身份的唯一人物三维表示和音视频特征表示,并将处理结果通过声韵运动转换模块进行解析生成控制信号,将控制信号输入多源自适应融合模块进行智能融合生成最终驱动三维面部运动的高保真控制指令,最后通过动态渲染与合成模块将驱动三维面部运动的高保真控制指高效、逼真地转化为连续的高保真说话人视频帧进行输出。