検索に戻る
案件記録

基于视觉文本提示引导的连续手语识别方法

発明有効
8請求項 · 1 独立
§ Ⅰ

案件概要

発明者

薛翠红; 袁龙灿; 袁甜甜; 高勇; 杨小燕; 马庆圆; 石妍

IPC分類

G06V 40/20 (2022.01)G06V 10/82 (2022.01)G06V 20/40 (2022.01)G06V 10/764 (2022.01)G06N 3/045 (2023.01)G06N 3/0464 (2023.01)G06N 3/0442 (2023.01)G06N 3/0499 (2023.01)G06N 3/0455 (2023.01)G06N 3/049 (2023.01)G06N 3/0985 (2023.01)

本发明为基于视觉文本提示引导的连续手语识别方法,在融合前进行帧级的语义条件化融合,在不引入外部传感器与骨架管线的前提下,并行构建经过视频编码器提取的帧级视觉特征序列经平均池化得到视频级视觉提示向量与文本提示提取模块获得的帧级文本提示向量。在提示引导融合模块中完成统一线性投影、拼接并经过多层感知机生成视觉‑文本提示向量,沿着时间维广播复制并与每帧主模型输出特征残差相加后进行层归一化完成逐帧融合,随后输入到编码器和CTC进行端到端训练,以提升特征表达的判别性与时序一致性,从而实现识别优化与特征优化的同步提升,增强模型的鲁棒性和识别性能。

外部リソース