Speech Gesture Generation from the Trimodal Context of Text, Audio, and Speaker Identity

Benchmark Model Rank Results
gesture-generation-on-beatTrimodal#2FID: 177.2
gesture-generation-on-beat2Trimodal#9FGD: 1.241
gesture-generation-on-ted-gesture-datasetTrimodal#5FGD: 3.729