CNIPA.AI
返回搜索
档案

基于多模态流式学习的普通话发音实时矫治方法及其系统

发明专利有效
10权利要求 · 2 独立
§ Ⅰ

卷宗概要

IPC 分类

G10L 21/013 (2013.01)G10L 21/02 (2013.01)G06N 3/08 (2023.01)G06F 18/25 (2023.01)

本发明公开了基于多模态流式学习的普通话发音实时矫治方法及其系统,属于语音处理技术领域,该方法采集用户语音信号和面部图像信息,对语音信号进行预处理和切分获得语音帧序列,利用人脸图像识别技术提取唇形及舌位特征,创新性地构建多模态拓扑特征空间,通过流形一致性映射建立语音与视觉特征间的时序对应关系,利用拓扑引导的注意力机制融合多模态特征,基于融合特征通过联合判别模型进行帧级音素预测,标记发音错误段落并生成针对性矫治建议,本发明还包括用户反馈与系统优化机制,实现个性化适应与持续优化,与现有技术相比,本发明通过多模态信息协同分析和拓扑数据分析赋能的深度融合,显著提高了发音错误检测的准确率和矫治效果。