검색으로 돌아가기
기록
基于通用音频语言多模态大模型的三阶段标签重标注方法及装置
발명유효
1조회수
10청구항 · 2 독립항
§ Ⅰ
개요
발명자
许可乐; 孙煜霖; 徐齐胜; 窦勇; 刘新旺
IPC 분류
G10L 25/27 (2013.01)G10L 25/18 (2013.01)G10L 25/03 (2013.01)
本申请涉及一种基于通用音频语言多模态大模型的三阶段标签重标注方法及装置。所述方法包括:先以音频特征提取模型,从处理后音频生成含整体描述、语音及音乐特征的三段式结构化描述;再将其嵌入语义增强型提示模板,输入标签预测语言模型,结合语料库统计特征的标签数量控制机制,生成匹配音频内容的预测标签;随后用多模态标签对齐模型,经三层匹配将预测标签映射至数据集原始标签类别,得到候选标签;最后通过余弦相似度计算候选标签与音频的相似度,保留得分不低于阈值的标签作为结果。该方法不依赖原始标签正确性,即便原始标签质量差、不完整,仍能输出高质量重标注结果,解决现有方法固有缺陷。