Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis

Benchmark Model Rank Results
text-to-video-generation-on-msr-vttSnap Video (288×288)FVD: 110.4CLIPSIM: 0.2793CLIP-FID: 8.48
text-to-video-generation-on-msr-vttSnap Video (512x288)FVD: 104.0CLIPSIM: 0.2793CLIP-FID: 9.35
text-to-video-generation-on-ucf-101Snap Video (Zero-shot, 288×288)FVD16: 260.1
text-to-video-generation-on-ucf-101Snap Video (Zero-shot, 512x288)FVD16: 200.2