검색으로 돌아가기
기록
一种面向大规模文本数据的主题挖掘方法
발명유효
1조회수
10청구항 · 1 독립항
§ Ⅰ
개요
발명자
朱希伟; 朱高伟; 王佳祥; 刘一君; 黄丽丽; 章景然
IPC 분류
G06F 40/258 (2020.01)G06F 40/284 (2020.01)G06F 16/335 (2019.01)G06N 3/0455 (2023.01)G06N 3/0499 (2023.01)G06N 3/084 (2023.01)
本发明属于主题挖掘技术领域,本发明公开了一种面向大规模文本数据的主题挖掘方法,包括,通过语音输入、输入法输入、扫描输入以及第三方数据源输入获取文本数据;对获取的文本数据进行预处理,得到规范化词数据;使用改进transformer模型对规范化词数据进行上下校正,得到词序列表示;基于transformer模型输出的词序列表示,使用NMF模型进行主题挖掘;在NMF模型中使用改进的BIC算法来确定最佳主题数K;针对挖掘出的主题使用余弦相似度技术进行评估,设置动态调整阈值来判断主题是否相似,将重复主题去除,获取文本的主题集;提高了主题挖掘的准确性和效率,为大规模文本数据的智能分析提供了有力的技术支持。