検索に戻る
案件記録
一种基于视觉大模型的图像筛选方法与系统
発明有効
8請求項 · 2 独立
§ Ⅰ
案件概要
発明者
秦熳; 李杰; 陈尧森
IPC分類
G06V 10/82 (2022.01)G06V 10/44 (2022.01)G06V 10/48 (2022.01)G06V 10/80 (2022.01)G06V 10/774 (2022.01)G06N 3/0455 (2023.01)G06N 3/09 (2023.01)
本申请公开了一种基于视觉大模型的图像筛选方法与系统,首先构建改进的视觉大模型,之后使用预训练数据集对所述多个视觉‑语言融合器进行训练,同时冻结所述视觉编码器和所述语言解码器的参数,得到训练后的视觉大模型,构建图像筛选任务的训练数据集,并基于LoRA技术对所述训练后的视觉大模型进行微调,得到图像筛选模型,利用图像筛选模型对待筛选图像及筛选条件进行分析,输出筛选结果。改进的视觉大模型包括ViT提取多层次图像特征、多个独立MLP融合器映射特征到语言空间、LLM解码器生成输出,结合LoRA微调技术,显著提升了图像筛选的准确性和效率,有效避免了图像信息损失并增强了在复杂筛选条件下的鲁棒性。
外部リソース