Multi-modality Associative Bridging through Memory: Speech Sound Recollected from Face Video

Benchmark Model Rank Results
lipreading-on-lip-reading-in-the-wild3D Conv + ResNet-18 + Bi-GRU + Visual-Audio Memory#9Top-1 Accuracy: 85.4
lipreading-on-lrw-10003D Conv + ResNet-18 + Bi-GRU + Visual-Audio Memory#4Top-1 Accuracy: 50.82%