
Imagen 是 Google Research(Brain Team)推出的一个文本到图像扩散模型,以其前所未有的照片级真实感和深度的语言理解能力著称。该模型融合了大型 Transformer 语言模型对文本的理解能力,以及扩散模型在生成高保真图像方面的优势,实现了从文本直接生成高质量图像的目标。



在 COCO 数据集上,Imagen 取得了 7.27 的 FID 分数(FID 越低越好),创下当时的新纪录,且该模型从未在 COCO 上训练过(zero-shot 评估)。人类评估者认为 Imagen 生成的样本在与文本对齐程度上与 COCO 原图质量相当。此外,Imagen 团队提出了 DrawBench——一个全面且富有挑战性的文本到图像模型基准测试,用于评估组合性、基数、空间关系、长文本、稀有词等能力。在 DrawBench 的侧对侧人类评估中,Imagen 在图像质量和文本对齐两方面均被评估者强烈偏好,优于 VQ-GAN+CLIP、Latent Diffusion Models 和 DALL-E 2 等方法。
