Tell Me What Happened: Unifying Text-guided Video Completion via Multimodal Masked Video Generation

Benchmark Model Rank Results
text-to-video-generation-on-msr-vttMMVG#9CLIPSIM: 0.2644FID: 23.4
video-generation-on-ucf-101MMVG (128x128, class-conditional)#19FVD16: 328Inception Score: 73.7
video-generation-on-ucf-101MMVG (128x128, unconditional)#25FVD16: 395Inception Score: 58.3
video-prediction-on-bair-robot-pushing-1MMVG#3FVD: 85.2