Imagen: Text-to-Image Diffusion Models

Imagen: Text-to-Image Diffusion Models

Google AI文字到图像生成模型

访问网站
AI训练模型131 次访问更新于 a month ago反馈
Imagen: Text-to-Image Diffusion Models screenshot

详细介绍

Imagen:文本到图像的扩散模型

Imagen 是 Google Research(Brain Team)推出的一个文本到图像扩散模型,以其前所未有的照片级真实感和深度的语言理解能力著称。该模型融合了大型 Transformer 语言模型对文本的理解能力,以及扩散模型在生成高保真图像方面的优势,实现了从文本直接生成高质量图像的目标。

A transparent sculpture of a duck made out of glass. The sculpture is in front of a painting of a landscape.

主要功能

  • 文本到图像生成:输入任意文本描述,Imagen 能生成对应的照片级逼真图像。例如,输入“一个由竹子制成的安卓吉祥物”或“骑着火箭飞向月球的大脑”等复杂描述,模型都能准确还原。
  • 高分辨率输出:通过级联扩散模型,Imagen 可将文本嵌入逐步映射为 64×64 的图像,再通过超分辨率扩散模型提升至 256×256 和最终 1024×1024 像素的高分辨率图像。
  • 深度语言理解:Imagen 使用大型预训练语言模型(如 T5-XXL)编码文本,对复杂的语义、空间关系、抽象概念(如“穿着空手道腰带的火龙果在雪中”)有深入的理解,生成图像与文本高度对齐。
  • 交互式示例:网站提供“点击单词生成图像”的互动功能,用户可选择不同的对象、动作、环境等组合,实时生成图像(如“一只穿着牛仔帽和红色衬衫的英国短毛猫在海滩上滑板”)。
A brain riding a rocketship heading towards the moon.

技术亮点

  • 大型预训练语言模型:Imagen 的关键发现是,直接使用在纯文本语料上预训练的大型语言模型(如 T5-XXL)编码文本,对图像合成的效果提升显著,且增大语言模型规模比增大扩散模型规模更能提升样本质量和图像-文本对齐度。
  • 级联扩散模型:采用“文本编码 → 条件扩散生成 64×64 图像 → 超分辨率扩散模型(64→256 和 256→1024)”的级联架构,实现高效高分辨率生成。
  • 新型阈值扩散采样器:引入新的阈值扩散采样方法,使得可以使用非常大的无分类器引导权重,进一步提升生成质量。
  • 高效 U-Net 架构:提出更高效的新型 U-Net,在计算效率、内存效率和收敛速度上均有提升。
Imagen architecture diagram

性能表现

在 COCO 数据集上,Imagen 取得了 7.27 的 FID 分数(FID 越低越好),创下当时的新纪录,且该模型从未在 COCO 上训练过(zero-shot 评估)。人类评估者认为 Imagen 生成的样本在与文本对齐程度上与 COCO 原图质量相当。此外,Imagen 团队提出了 DrawBench——一个全面且富有挑战性的文本到图像模型基准测试,用于评估组合性、基数、空间关系、长文本、稀有词等能力。在 DrawBench 的侧对侧人类评估中,Imagen 在图像质量和文本对齐两方面均被评估者强烈偏好,优于 VQ-GAN+CLIP、Latent Diffusion Models 和 DALL-E 2 等方法。

适用场景

  • 创意设计与插画:设计师和艺术家可通过文本描述快速生成概念草图、插画或视觉素材,加速创意流程。
  • 内容生成:用于广告、社交媒体、出版物等场景,根据文字描述自动生成配图。
  • 教育与研究:作为文本到图像技术的典范,Imagen 可用于学术研究、教学演示和探索语言与视觉的关联。
  • 辅助视觉表达:帮助无法绘画的用户将脑海中的想法转化为图像,用于沟通、演示或记录。
A photo of a Corgi dog riding a bike in Times Square. It is wearing sunglasses and a beach hat.