CNIPA.AI
검색으로 돌아가기
기록

基于人工智能的复杂场景文本识别增强方法

발명유효
2청구항 · 1 독립항
§ Ⅰ

개요

발명자

欧珠; 边巴卓玛; 丹增阿旺; 谢志东

IPC 분류

G06V 30/19 (2022.01)G06V 30/18 (2022.01)G06V 10/77 (2022.01)G06V 10/70 (2022.01)G06V 10/82 (2022.01)G06N 3/0455 (2023.01)G06N 3/092 (2023.01)G06N 5/04 (2023.01)

本发明涉及计算机视觉领域,具体是指基于人工智能的复杂场景文本识别增强方法,包括复杂场景文本图像构建划分、条件特征融合、对比学习优化潜在空间表示、解码重构、损失函数优化、潜变量提取与增强特征输出、强化学习优化和最终识别输出,引入变分自编码器结构,结合对比学习优化潜在空间表示,使得模型能够在多种字体、光照和噪声条件下学习到具有判别性的潜变量表示,在潜变量空间中引入正负样本对比约束,降低不同场景下特征分布差异;本发明在复杂场景文本识别中引入强化学习框架,将识别结果与置信度作为状态输入,通过Actor–Critic结构策略网络学习动态增强策略,通过定义线性与非线性复合奖励函数,实现识别错误率与置信度提升的联合优化。