Make-A-Video: Text-to-Video Generation without Text-Video Data

Benchmark Model Rank Results
text-to-video-generation-on-msr-vttMake-A-Video#7CLIPSIM: 0.3049CLIP-FID: 13.17FID: 13.17
text-to-video-generation-on-msr-vttCogVideo (English)#10CLIPSIM: 0.2631CLIP-FID: 23.59FID: 23.59
video-generation-on-ucf-101Make-A-Video (Finetuning, 256x256, class-conditional)#6FVD16: 81.25Inception Score: 82.55
video-generation-on-ucf-101Make-A-Video (Zero-shot, 256x256, class-conditional)#23FVD16: 367.23Inception Score: 33