검색으로 돌아가기
기록
基于多通道协同融合的多模态实体链接方法
발명유효
12청구항 · 4 독립항
§ Ⅰ
개요
발명자
李华昱; 贺晓桐
IPC 분류
G06N 5/04 (2023.01)G06F 40/35 (2020.01)G06F 16/3329 (2025.01)G06F 40/279 (2020.01)G06V 10/72 (2022.01)G06V 10/80 (2022.01)G06V 10/764 (2022.01)G06V 10/82 (2022.01)G06F 18/25 (2023.01)G06F 18/15 (2023.01)G06F 18/22 (2023.01)G06V 10/74 (2022.01)G06N 3/0442 (2023.01)G06N 3/084 (2023.01)
本发明属于自然语言处理和计算机视觉交叉技术领域。针对现有多模态实体链接方法存在的语义层次单一、视觉噪声干扰、跨模态对齐不充分、协同推理缺失等问题,提出一种基于多通道协同融合的方法。该方法构建包含文本语义、视觉感知、跨模态对齐和协作实体四个并行通道的融合架构,通过层次注意力机制实现深层与表层语义双重对齐,通过动态门控机制过滤视觉噪声,通过共同语义空间映射实现文本与视觉深层对齐,通过协同特征聚合增强多提及推理能力,采用整体损失与各通道独立损失相结合的多通道一致性目标函数实现均衡训练。本发明适用于知识图谱构建、智能问答系统、多媒体内容理解等场景,显著提升了多模态实体链接的准确性和鲁棒性。