返回搜索
档案
一种基于大模型的图像描述文本的生成方法
发明专利有效
10权利要求 · 1 独立
§ Ⅰ
卷宗概要
发明人
张晶; 朱金晨
IPC 分类
G06V 10/774 (2022.01)G06V 10/30 (2022.01)G06V 10/44 (2022.01)G06V 10/80 (2022.01)G06V 10/75 (2022.01)G06V 10/74 (2022.01)G06V 10/766 (2022.01)G06V 10/26 (2022.01)G06V 10/52 (2022.01)G06V 10/50 (2022.01)G06N 3/0464 (2023.01)G06N 3/0455 (2023.01)G06N 3/0895 (2023.01)G06N 3/082 (2023.01)G06N 3/0475 (2023.01)G06N 3/045 (2023.01)G06N 3/094 (2023.01)G06N 3/096 (2023.01)G06N 5/022 (2023.01)G06T 5/94 (2024.01)
本发明公开了一种基于大模型的图像描述文本的生成方法,涉及图像处理技术领域,包括图像预处理步骤,采用混合去噪与自适应归一化,通过语义分割划分目标层级并提取关键视觉信息;特征提取步骤,融合多尺度视觉特征与语义特征,经跨模态对齐生成高维融合特征向量;大模型初始化与适配步骤,加载预训练模型并增量式微调,动态调整Prompt模板;文本生成步骤,通过逻辑约束与束搜索生成候选文本;文本优化调整步骤,基于多维度评估与用户偏好迭代修正,输出最终描述文本。本发明提升图像描述的语义匹配度、逻辑连贯性与常识准确性,通过动态适配与迭代优化适配多元场景,为高精度与多样化场景提供高质量文本描述支持。