| Benchmark | Model | Rank | Results |
|---|---|---|---|
| audio-visual-active-speaker-detection-on-ava | VTP (visual only) | – | validation mean average precision: 89.2% |
| lipreading-on-lrs2 | VTP | – | Word Error Rate (WER): 28.9 |
| lipreading-on-lrs2 | VTP (more data) | – | Word Error Rate (WER): 22.6 |
| lipreading-on-lrs3-ted | VTP | – | Word Error Rate (WER): 40.6 |
| lipreading-on-lrs3-ted | VTP (more data) | – | Word Error Rate (WER): 30.7 |
| visual-speech-recognition-on-lrs3-ted | VTP | – | Word Error Rate (WER): 40.6 |
| visual-speech-recognition-on-lrs3-ted | VTP with more data | – | Word Error Rate (WER): 30.7 |