SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization

Benchmark Model Rank Results
landmark-based-lipreading-on-lrwSyncVSR (Word Boundary)#1Top 1 Accuracy: 80.3
landmark-based-lipreading-on-lrwSyncVSR#2Top 1 Accuracy: 75.1
lipreading-on-lip-reading-in-the-wildSyncVSR (Word Boundary)#1Top-1 Accuracy: 95.0
lipreading-on-lip-reading-in-the-wildSyncVSR#3Top-1 Accuracy: 93.2
lipreading-on-lrs2SyncVSR#3Word Error Rate (WER): 16.5
lipreading-on-lrs2SyncVSR#6Word Error Rate (WER): 28.9
lipreading-on-lrs3-tedSyncVSR#2Word Error Rate (WER): 21.5
lipreading-on-lrs3-tedSyncVSR#10Word Error Rate (WER): 31.2
lipreading-on-lrw-1000SyncVSR (Word Boundary)#1Top-1 Accuracy: 58.2