CNIPA.AI
검색으로 돌아가기
기록

基于多层次多模态对齐用来缓解幻觉的视频语言模型

발명유효
1조회수
10청구항 · 1 독립항
§ Ⅰ

개요

발명자

党吉圣; 王笔美; 王怡嘉; 王悉文; 胡斌

IPC 분류

G06V 10/774 (2022.01)G06V 10/22 (2022.01)G06V 10/82 (2022.01)G06V 10/74 (2022.01)G06T 9/00 (2006.01)G06N 3/045 (2023.01)G06N 5/04 (2023.01)

本发明提供了一种基于多层次多模态对齐用来缓解幻觉的视频语言模型,包括:视觉特征提取模块,用于使用预训练的视觉编码器对输入视频帧进行编码,提取视频帧的视觉特征;文本语义对齐单元,用于基于文本编码器将视频的文本提示和标签转换为语义特征;以及语义判别模块,用于通过对比学习将语义特征与视觉特征进行对齐。通过结合文本编码器和语义判别模块,增强中间视觉特征的语义辨别能力,从而达到增强语义辨别能力,减少幻觉现象的目的。