検索に戻る
案件記録
融合检索与大模型蒸馏的嵌入数据合成方法、装置及介质
発明有効
10請求項 · 4 独立
§ Ⅰ
案件概要
出願人
北京衔远有限公司
発明者
李凯祥; 陈懿诚; 谢树雷
IPC分類
G06F 40/30 (2020.01)G06N 5/02 (2023.01)G06N 3/0895 (2023.01)G06N 5/04 (2023.01)G06N 3/0455 (2023.01)G06F 18/22 (2023.01)G06F 18/25 (2023.01)G06F 18/10 (2023.01)
本申请提供一种融合检索与大模型蒸馏的嵌入数据合成方法、装置及介质。该方法包括:对垂直领域的非结构化文档进行预处理,将非结构化文档划分为具有层级关联关系的多粒度文本块;基于多粒度文本块组合形成上下文,将垂直领域先验知识对应的扰动信息注入上下文,调用生成模型根据上下文生成检索查询,并确定与检索查询对应的目标文本块作为初始正样本;根据文本块之间的关联关系过滤假负样本文本块,形成正样本集合和负样本集合;构建对比学习训练样本,利用对比学习训练样本训练语义表征模型,以生成用于检索任务的嵌入向量。本申请能够提高检索任务构造效率及真实性、提升正样本覆盖完整性、增强对比学习训练稳定性与检索精度。
外部リソース