検索に戻る
案件記録
一种基于多模态大模型的影视视频剧本自动化提取方法
発明有効
10請求項 · 1 独立
§ Ⅰ
案件概要
発明者
张悦枫; 任建新; 高彤; 张宁
IPC分類
G06F 18/25 (2023.01)G06V 20/40 (2022.01)G06V 10/82 (2022.01)G06V 40/20 (2022.01)G10L 25/18 (2013.01)G10L 25/48 (2013.01)
本发明涉及一种基于多模态大模型的影视视频剧本自动化提取方法,属于人工智能与视频内容分析领域。本发明针对现有自动语音识别工具无法生成结构化剧本的问题,首先对输入视频进行多模态分解,采用场景自适应策略抽帧并建立音画时间戳对齐映射;随后通过CLIP‑ViT视觉特征编码器和Whisper音频特征编码器提取特征,利用跨模态注意力机制关联语义;实现角色身份识别、场景类型识别及动作文字描述,最终生成符合标准化规范的剧本文件,包含场景标题、时间码标记及特殊叙事标记。相对于人工听写标记与自动语音识别工具的方式,本发明有效提升影视视频剧本提取的准确性和效率。
外部リソース