Taming Transformers for High-Resolution Image Synthesis

Benchmark Model Rank Results
deepfake-detection-on-fakeavceleb-1VQGAN#8ROC AUC: 51.8AP: 55.0
image-generation-on-celeba-256x256VQGAN#12FID: 10.2
image-generation-on-celeba-hq-256x256VQGAN+Transformer#11FID: 10.2
image-generation-on-ffhq-256-x-256VQGAN+Transformer#34FID: 9.6
image-generation-on-imagenet-256x256VQGAN+Transformer (k=600, p=1.0, a=0.05)#80FID: 5.2
image-generation-on-imagenet-256x256VQGAN+Transformer (k=mixed, p=1.0, a=0.005)#82FID: 6.59
image-outpainting-on-lhqcTaming#4Block-FID (Right Extend): 22.53Block-FID (Down Extend): 26.38
image-reconstruction-on-imagenetTaming-VQGAN (16x16)#15FID: 3.64LPIPS: 0.177PSNR: 19.93SSIM: 0.542
image-reconstruction-on-ultra-high-resolutionVQGAN (16x16)#5rFID: 5.95PSNR: 22.91
image-to-image-translation-on-ade20k-labelsVQGAN+Transformer#11FID: 35.5
image-to-image-translation-on-coco-stuffVQGAN+Transformer#5FID: 22.4
text-to-image-generation-on-conceptualVQ-GAN#4FID: 28.86
text-to-image-generation-on-lhqcTaming#3Block-FID: 38.89