검색으로 돌아가기
기록
一种基于视觉语言多模态大模型的长尾场景处理系统
발명유효
2조회수
10청구항 · 1 독립항
§ Ⅰ
개요
발명자
唐俊垚
IPC 분류
G06V 20/70 (2022.01)G06V 10/94 (2022.01)G06V 10/80 (2022.01)G06V 30/18 (2022.01)G06N 5/04 (2023.01)
本发明公开了一种基于视觉语言多模态大模型的长尾场景处理系统,该系统以视觉语言多模态大模型(Xiaoyi Vision‑Language Multi‑Modal Large Language Model)为核心底座,包含多模态融合处理模块、像素级精细分析模块、智能推理调度模块及零样本长尾场景处理模块;通过统一处理图像与文本输入,实现像素级视觉特征提取、自适应推理路径选择,无需针对特定场景定制训练即可完成长尾场景的分析处理;解决了传统视觉算法数据依赖强、长尾处理难、泛化能力弱、维护成本高的问题,减少90%以上场景特定算法开发投入,将新场景响应时间从数月缩短至数天,单张图像分析耗时小于2秒,支持7×24小时连续运行及64路并发推理,可广泛应用于交通、水利、施工等多领域视觉分析任务。