검색으로 돌아가기
기록
一种基于检索增强生成的语音识别方法、设备及介质
발명유효
1조회수
10청구항 · 3 독립항
§ Ⅰ
개요
발명자
王灿; 杨彤; 薛兵; 张吉臣; 李雪
IPC 분류
G10L 15/26 (2006.01)G10L 15/16 (2006.01)G10L 21/0208 (2013.01)G10L 15/18 (2013.01)G06N 3/0464 (2023.01)G06N 3/045 (2023.01)
本发明公开了一种基于检索增强生成的语音识别方法、设备及介质,属于语音识别技术领域,用于解决现有语音识别系统在噪声环境下关键词识别准确率低,且对特定领域下的术语识别能力不足的技术问题。方法包括:将预处理后的音频信号进行有关语音编码器的核心特征提取处理,生成高维特征信息;对高维特征信息进行有关语音‑文本特征下的跨模态对齐与检索相似度计算,得到检索结果信息;将检索结果信息与高维特征信息进行加权合并处理,得到融合特征信息;将融合特征信息映射到大语言模型的嵌入空间中,得到兼容特征信息;对兼容特征信息进行文本序列的自回归生成处理,得到文本转录信息;输出最终文本识别结果。