검색으로 돌아가기
기록
基于大语言模型的多领域知识驱动视觉问答方法
발명유효
9청구항 · 3 독립항
§ Ⅰ
개요
발명자
杨鹏; 刘丰源; 杨冬梅; 王振棋; 王鹏
IPC 분류
G06N 5/04 (2023.01)G06N 5/022 (2023.01)G06N 3/045 (2023.01)G06F 40/30 (2020.01)G06F 18/22 (2023.01)G06V 10/82 (2022.01)G06V 10/40 (2022.01)G06F 18/213 (2023.01)G06F 16/9035 (2019.01)G06F 16/9032 (2019.01)G06F 16/58 (2019.01)G06N 3/047 (2023.01)G06N 3/0499 (2023.01)
本发明公开了一种基于大语言模型的多领域知识驱动视觉问答方法,首先,通过预训练的视觉问答模型生成多组候选答案及其置信度,其次,利用视觉大语言模型生成图像初始标题,并通过对齐视觉与文本特征从知识库中检索相关文档,结合语义一致性奖励与语言合理性评分构建综合奖励函数;基于该函数对标题进行多轮迭代优化,若评分未达阈值则引入建议生成模块引导语义增强。最后,将优化后的图像标题与上下文示例、候选答案及筛选知识结构化整合为统一模板,输入大语言模型生成精准可解释的答案输出。本发明具备强语义对齐能力与幻觉抑制机制,能够有效提升模型在复杂专业知识背景下的多模态推理性能,适用于医疗、教育等多种专业领域的视觉问答任务。