検索に戻る
案件記録
文本到图像生成方法、装置、设备、存储介质及产品
発明有効
10請求項 · 5 独立
§ Ⅰ
案件概要
発明者
钟宇; 陈晓晖; 黄浩翔; 李冠文; 杨卫
IPC分類
G06T 11/10 (2026.01)G06F 40/30 (2020.01)G06F 18/10 (2023.01)G06N 3/0455 (2023.01)G06N 5/04 (2023.01)G06N 3/045 (2023.01)G06N 3/096 (2023.01)G06N 3/0464 (2023.01)G06N 3/048 (2023.01)G06N 3/084 (2023.01)
本申请公开了一种文本到图像生成方法、装置、设备、存储介质及产品,涉及人工智能技术领域,公开的文本到图像生成方法包括:接收输入文本,通过大语言模型解析输入文本中的多个语义实体及语义实体之间的空间关系,得到输入文本对应的布局信息,其中,布局信息包括各语义实体在图像中的位置范围;将布局信息转换为与扩散模型潜空间特征图尺寸对应的掩码集合;将掩码集合和输入文本输入扩散模型,并在扩散模型对输入文本的去噪过程中,基于掩码集合进行语义校正,得到目标图像。本申请能够提高文本到图像生成时生成图像与输入文本的匹配度。
外部リソース