CNIPA.AI
返回搜索
档案

基于大语言模型的语音识别文本纠错方法、设备及介质

发明专利有效
10权利要求 · 3 独立
§ Ⅰ

卷宗概要

IPC 分类

G10L 15/26 (2006.01)G10L 15/04 (2013.01)G10L 15/18 (2013.01)G10L 15/08 (2006.01)

本申请属于自然语言处理技术领域,揭示一种基于大语言模型的语音识别文本纠错方法、设备及介质,其首先分割音频数据获得多个音频片段;再调用自动语音识别引擎识别音频片段获得音频片段的文本内容,并利用音频编码器对音频片段进行编码获得对应的音频编码;之后基于音频片段对应的文本内容和音频编码以及音频片段的发出顺序,构造包含历史上下文信息的多模态对话记录,该多模态对话记录包括多段对话记录,对话记录基于音频片段的发出顺序排序,对话记录包括音频片段对应的音频编码和文本内容;最后定义包括有该多模态对话记录的模型输入数据,将该模型输入数据输入大语言模型,通过大语言模型实现音频识别结果的高精度纠错。