検索に戻る
案件記録
一种基于大语言模型与分类模型的源代码摘要数据集质量优化方法
発明有効
10請求項 · 3 独立
§ Ⅰ
案件概要
発明者
王智慧; 姜艺; 朱俊武; 章永龙
IPC分類
G06F 8/73 (2018.01)G06F 8/30 (2018.01)G06F 18/241 (2023.01)G06N 5/04 (2023.01)
本发明公开了一种基于大语言模型与分类模型的源代码摘要数据集质量优化方法,所述方法包括:从源代码摘要数据集中提取代码及其注释的数据对;标注注释,将注释分为功能性描述注释和非功能性描述注释;评估多种大语言模型的分类性能,选择表现最优的模型作为标注器构建注释分类数据集,训练开源大模型CodeBERT;基于训练后的开源大模型CodeBERT对大规模源代码摘要数据集进行筛选,去除低质量注释并保留高质量注释;本发明解决了传统源代码摘要数据集质量差的问题,不仅提升了数据集的质量,还有效地降低了高成本闭源大语言模型的依赖,同时通过自动化方法提高了效率,具有实用价值和广泛的应用前景。
外部リソース