検索に戻る
案件記録

一种基于大模型的多场景文本识别方法及系统

発明有効
9請求項 · 2 独立
§ Ⅰ

案件概要

発明者

张帆; 王海洋; 邵丽青; 韩胜强; 冯乾隆; 郭雅鑫; 刘磊; 智云胜; 刘倩

IPC分類

G06V 30/418 (2022.01)G06V 10/44 (2022.01)G06V 10/764 (2022.01)G06N 3/0455 (2023.01)G06V 10/75 (2022.01)G06N 3/084 (2023.01)

本发明提供一种基于大模型的多场景文本识别方法及系统,属于多场景文本识别技术领域;该方法包括基于多场景图像样本构建训练数据集;利用训练数据集对提示引擎进行训练,获取待识别图像,提取待识别图像的图像视觉特征向量并输入至训练后的提示引擎,得到待识别图像的提示词模板标识符;将目标提示词与待识别图像输入至文本识别模型,文本识别模型输出文本识别结果。本发明通过引入可训练的提示引擎,本发明通过可训练的提示引擎,利用输入图像的视觉特征来筛选出与当前场景最相关的提示词,并利用该提示词为文本识别模型提供场景化、针对性的识别指引,有效破解了单一文本识别模型在多样场景下泛化能力薄弱的技术难题。

外部リソース