CNIPA.AI
검색으로 돌아가기
기록

一种基于视频和文本融合的轻量级Transformer视频动作识别方法

발명유효
4조회수
3청구항 · 1 독립항
§ Ⅰ

개요

발명자

吴文波; 余明; 吴昌钱

IPC 분류

G06V 20/40 (2022.01)G06V 10/80 (2022.01)G06V 10/82 (2022.01)G06V 20/62 (2022.01)G06V 40/20 (2022.01)G06N 3/0455 (2023.01)G06N 3/0464 (2023.01)G06N 3/08 (2023.01)

本发明涉及视频动作识别领域,具体涉及一种基于视频和文本融合的轻量级Transformer视频动作识别方法,包括如下依次执行的步骤:S1:获取视频数据集,从该视频数据集中获取关键帧图像集和文本集;S2:采用三维卷积神经网络提取该关键帧图像集的时空视觉特征,获得结构化的视频视觉特征,采用预训练双向Transformer语言模型(BERT)提取文本集的语义特征;S3:将该视频视觉特征和该语义特征输入轻量级Transformer融合层进行特征融合,获取融合特征;S4:将该融合特征输入全连接层,将融合特征映射到动作类别空间,并进行Softmax归一化操作,将归一化后的特征输入分类器进行动作预测,输出动作类别以及对应的概率值;从而提高视频动作识别的准确率。