CNIPA.AI
Back to Search
Dossier

一种基于视觉语言模型的语义场景重建与交互方法及系统

InventionActive
1views
10Claims · 4 independent
§ Ⅰ

Dossier Overview

Inventor

蒋笑寒; 张日崇

IPC Classification

G06T 17/05 (2011.01)G06N 5/04 (2023.01)

本发明提供一种基于视觉语言模型的语义场景重建与交互方法及系统,涉及人工智能和机器人技术领域。该方法包括:获取相机拍摄的图像数据;估计相机的世界位姿;将图像数据输入至视觉语言模型(VLM),以生成包含物体语义标签及其相对于相机的定量空间信息的结构化描述;根据相机位姿和所述定量空间信息,计算物体的世界位姿;在一个层次化场景图中创建或更新代表所述物体的节点。本发明还提供相应的交互系统。该方法通过深度融合VLM的语义理解能力和SLAM的几何建图能力,构建了一个丰富、直观且面向自然语言交互的三维语义地图,极大地提升了机器人环境感知和人机交互的智能化水平。

External Resources