検索に戻る
案件記録
融合跨域负样本的源代码识别方法、装置、设备及介质
発明有効
10請求項 · 4 独立
§ Ⅰ
案件概要
発明者
邱志斌; 涂高元; 郭永兴; 陆云燕; 游荣彪
IPC分類
G06F 16/353 (2025.01)G06F 40/126 (2020.01)G06F 40/253 (2020.01)G06N 3/0464 (2023.01)
本申请提供一种融合跨域负样本的源代码识别方法、装置、设备及介质,涉及计算机技术领域。方法包括:对待测文本进行数据预处理,得到目标文本;将目标文本输入预先训练的源代码识别模型,得到源代码识别模型输出的识别结果,识别结果指示待测文本的类别。本申请的所述源代码识别模型是基于样本集对Very Deep Convolutional Neural Network(VDCNN)模型进行训练得到的,样本集包括源代码样本和非源代码样本。本申请针对现有技术对非代码文本区分能力不足的问题,在训练源代码识别模型时,在多种编程语言类别的源代码样本层面,引入包含英文新闻、雅虎问答记录、小说片段等文本作为跨域负样本,有效避免了非代码文本检测为源代码,从而在实际文件处理场景中展现出更高的识别准确率。
外部リソース