VideoPoet: A Large Language Model for Zero-Shot Video Generation

Benchmark Model Rank Results
text-to-video-generation-on-msr-vttVideoPoetFVD: 213CLIPSIM: 0.3123
text-to-video-generation-on-ucf-101VideoPoetFVD16: 355
video-generation-on-ucf-101VideoPoet (text-conditional)FVD16: 355Inception Score: 38.44