CNIPA.AI
返回搜索
档案

一种基于掩码处理的PDF文件版面识别的方法

发明专利有效
10权利要求 · 1 独立
§ Ⅰ

卷宗概要

发明人

陈晨; 李嘉成; 云尧

IPC 分类

G06V 30/413 (2022.01)G06V 30/412 (2022.01)G06V 30/416 (2022.01)G06V 30/146 (2022.01)G06V 30/19 (2022.01)G06V 10/766 (2022.01)G06V 10/82 (2022.01)

本发明公开了一种基于掩码处理的PDF文件版面识别的方法,旨在实现PDF文件中标题、正文、页眉、页脚、表格和图片等多种版面元素的精准识别。该方法通过MuPDF解析PDF文件中的文字及其坐标,采用不同颜色掩码分别替换文本和标点符号,保留非文本区域原始内容,生成掩码处理后的页面图片,并基于此构建训练数据集,利用目标检测模型(如YOLO)进行训练,得到高精度的版面识别模型。本发明有效提升了PDF版面识别的准确性和自动化水平,具有广泛的应用前景。