Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models

Benchmark Model Rank Results
text-to-video-generation-on-msr-vttVideo LDM#8CLIPSIM: 0.2929
text-to-video-generation-on-msr-vttCogVideo (Chinese)#11CLIPSIM: 0.2614CLIP-FID: 24.78
text-to-video-generation-on-ucf-101Video LDM (Zero-shot, 320x512)#3FVD16: 550.61
video-generation-on-ucf-101Video LDM (320x512, text-conditional)#30FVD16: 550.61Inception Score: 33.45