CNIPA.AI
返回搜索
档案

融合CNN与Transformer的自监督单目深度估计系统及方法

发明专利有效
9权利要求 · 2 独立
§ Ⅰ

卷宗概要

发明人

王西超; 张嘉成; 赵淑阳; 朱晨烜

IPC 分类

G06T 7/579 (2017.01)G06T 7/246 (2017.01)G06T 7/73 (2017.01)G06V 10/42 (2022.01)G06V 10/44 (2022.01)G06V 10/52 (2022.01)G06V 10/70 (2022.01)G06V 10/80 (2022.01)G06V 10/82 (2022.01)G06N 3/0455 (2023.01)G06N 3/0464 (2023.01)G06N 3/0895 (2023.01)

本发明涉及计算机视觉技术领域,具体公开了一种融合CNN与Transformer的自监督单目深度估计系统及方法。该系统通过多尺度特征融合机制强化局部表征,构建跨区域注意力网络实现全局上下文关联,实现复杂场景细微结构的精细还原。首先基于DCB,采用多层扩张卷积来扩展感受野并融合多尺度像素特征,增强关键区域的局部细节;其次利用ELGF的并行局部卷积捕捉图像细粒度局部信息,同时使用自注意力机制获取长距离依赖,实现局部信息与全局依赖的协同建模,显著增强特征表达能力;最后通过基于预训练的ResNet18的轻量级编码器估计相邻图像间的相对位姿,构建重投影损失以优化深度预测。实验表明,本发明构建的模型在AbsRel和RMSE指标上分别达到0.102和4.430,显著优于现有主流方法。