CNIPA.AI
검색으로 돌아가기
기록

基于视觉大模型的场景重建与语义理解方法及系统

발명유효
10청구항 · 4 독립항
§ Ⅰ

개요

IPC 분류

G06V 20/70 (2022.01)G06V 10/764 (2022.01)G06V 10/774 (2022.01)G06V 10/82 (2022.01)G06V 20/64 (2022.01)G06N 3/0455 (2023.01)G06N 3/0464 (2023.01)G06N 3/0475 (2023.01)G06N 3/084 (2023.01)G06N 3/0985 (2023.01)G06T 17/20 (2006.01)

本发明提供一种基于视觉大模型的场景重建与语义理解方法及系统,涉及计算机视觉与三维重建领域,包括获取目标场景的多视角图像数据,输入预训练视觉大模型,输出联合特征表示与注意力权重矩阵;根据联合特征表示在三维空间生成空间采样点的三维坐标值与语义概率分布,构建空间语义场;利用注意力权重矩阵将空间采样点聚类并进行语义一致性强化,转换为确定性语义标签;构建几何优化目标函数,调整三维坐标值;提取相同语义标签的连续空间采样点形成物体边界,构建场景拓扑图并推断场景功能结构,生成导航路径。本发明实现了场景的精确几何重建与深层语义理解的统一,提升了三维重建精度和语义分析准确性,为智能导航提供可靠支撑。