Back to Search
Dossier
一种融合统计熵与多因子的文本相似度数据处理方法
InventionActive
10Claims · 1 independent
§ Ⅰ
Dossier Overview
Inventor
丁鑫玺; 洪锦雨; 柴邝嘉; 陈康盈; 李沛璇; 董丽华; 黄景碧
IPC Classification
G06F 18/22 (2023.01)G06F 12/02 (2006.01)
本发明涉及电数字数据处理技术领域,公开了一种融合统计熵与多因子的文本相似度数据处理方法,包括:处理器提取第一及第二数据序列的互不包含极大公共子串集合,计算子串长度平方和生成局部统计熵;遍历极大公共子串集合,获取其在第一及第二数据序列内存空间中的存储地址索引,构建映射结构位移关系的拓扑映射向量;利用归并排序算法计算拓扑映射向量的逆序对总数,生成归一化的拓扑耗散指数;以局部统计熵为信息载波,以拓扑耗散指数为结构阻尼因子,执行非线性阻尼调制运算得到最终相似度评分,本发明通过量化数据在存储空间分布的拓扑熵增,解决线性扫描逻辑无法识别块级位移的技术难题。
External Resources