検索に戻る
案件記録

用于视频生成的自回归语言模型

発明有効
20請求項 · 3 独立
§ Ⅰ

案件概要

発明者

周大权; 林志杰; 康炳易; 赵阳; 冯佳时

IPC分類

H04N 21/854 (2011.01)H04N 21/81 (2011.01)G06F 18/214 (2023.01)G06N 3/045 (2023.01)G06N 3/0464 (2023.01)

本公开的实施例涉及用于视频生成的自回归语言模型。提供了使用视频生成模型自回归地生成视频的实施方式。一方面包括一种方法,所述方法包括:执行包括第一阶段和第二阶段的渐进式多阶段训练过程,其中:第一阶段包括训练用以执行文本到图像生成的视频生成模型;并且第二阶段包括使用包括带标签的视频‑文本对的训练数据集来进一步训练视频生成模型,其中进一步训练视频生成模型包括:针对每个带标签的视频‑文本对:使用文本标记化器和带标签的视频‑文本对的文本注释来生成至少一个文本标记;使用视频标记化器和带标签的视频‑文本对的视频来生成多个视频标记;使用至少一个文本标记来自回归地生成帧标记;以及使用从帧标记和视频标记计算的损失值来训练视频生成模型。

外部リソース