Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation

Benchmark Model Rank Results
text-to-image-generation-on-cocoSwinv2-ImagenFID: 7.21Inception score: 31.46
text-to-image-generation-on-cubSwinv2-ImagenFID: 9.78Inception score: 8.44
text-to-image-generation-on-multi-modalSwinv2-ImagenFID: 10.31