返回搜索
档案
基于多模型动态切换的语音识别方法及系统、电子设备
发明专利有效
10权利要求 · 3 独立
§ Ⅰ
卷宗概要
发明人
刘溢; 韩晓玉; 郭熹; 白林; 刘艳伟; 齐博宇; 熊梅艳
IPC 分类
G10L 15/26 (2006.01)G10L 15/18 (2013.01)G10L 19/16 (2013.01)G06N 3/0442 (2023.01)G06N 3/045 (2023.01)
本公开提供了一种基于多模型动态切换的语音识别方法及系统、电子设备,涉及语音识别技术领域,包括:实时获取音频数据流以及相应的传感器数据流,形成多模态数据流;提取音频数据流中的音频特征以及传感器数据流中的情景特征,编码为统一上下文状态向量;基于所述统一上下文状态向量,预测未来时间步的场景信息并生成模型权重向量;将所述统一上下文状态向量注入至专家模型库的若干专家模型中并行处理,并各自输出词元概率分布;将所述词元概率分布根据所述模型权重向量进行动态加权求和,融合后的最终概率分布经过解码生成语音识别文本。能够实现模型间的无缝、平滑过渡,保证了最终识别文本的高度连贯性。