검색으로 돌아가기
기록
多模态语音交互方法、装置、智能设备及可读存储介质
발명유효
10청구항 · 4 독립항
§ Ⅰ
개요
발명자
许学成; 黄世奇; 林惠惠; 鲁思帆; 安正义; 李泽
IPC 분류
G10L 15/18 (2013.01)G10L 15/22 (2006.01)G10L 15/26 (2006.01)G06V 20/52 (2022.01)G06V 40/20 (2022.01)G06V 40/16 (2022.01)G06V 40/18 (2022.01)
本申请提供了一种多模态语音交互方法、装置及智能设备,适用于智能语音交互技术领域,应用于智能设备,方法包括:响应于检测到的语音活动,提取语音活动中的第一语音数据,并获取与第一语音数据同步拍摄的视频数据,视频数据中拍摄有多个不同用户。从视频数据中筛选出发出第一语音数据的目标用户。对第一语音数据对应的文本内容进行语义完整性分析。当语义完整性分析的结果为语义不完整时,继续获取目标用户若干次的第二语音数据,并生成第一语音数据和第二语音数据结合后对应的语义完整的目标语句。针对目标语句生成回复数据,并语音输出回复数据。本申请实施例可以实现与所需交互用户的精准、连贯且实时的语音交互。