Distinguishing Homophenes Using Multi-Head Visual-Audio Memory for Lip Reading

Benchmark Model Rank Results
lipreading-on-lip-reading-in-the-wild3D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio Memory#6Top-1 Accuracy: 88.5
lipreading-on-lrs2Multi-head Visual-Audio Memory#10Word Error Rate (WER): 44.5
lipreading-on-lrw-10003D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio Memory#3Top-1 Accuracy: 53.8