검색으로 돌아가기
기록
一种视觉语言模型预训练方法及一种电子设备
발명유효
13청구항 · 2 독립항
§ Ⅰ
개요
발명자
金良; 杜国光; 闫瑞栋; 贾麒; 徐聪; 范宝余
IPC 분류
G06V 10/774 (2022.01)G06V 10/764 (2022.01)G06V 10/72 (2022.01)G06V 10/44 (2022.01)G06V 10/82 (2022.01)G06N 3/045 (2023.01)
本申请公开了一种视觉语言模型预训练方法及一种电子设备,涉及计算机技术领域,该方法包括:对输入图像进行编码得到第一图像编码,在第一图像编码中添加分类令牌、分类提示和图像提示得到第二图像编码;将第二图像编码输入自注意力层进行处理,通过注意力掩码机制约束分类提示与分类令牌进行交互、图像提示与第一图像编码对应的图像令牌进行交互得到第三图像编码;整合第二图像编码和第三图像编码得到第四图像编码,对第四图像编码进行归一化和残差连接得到第五图像编码,重复上述步骤得到目标图像编码;基于目标图像编码构建输入图像对应的视觉表征,基于文本编码和视觉表征计算损失对模型参数进行训练。本申请提升了视觉语言模型的预训练效果。