Large Language Models are Strong Audio-Visual Speech Recognition Learners

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrs3-tedLlama-AVSR#3Word Error Rate (WER): 0.77
speech-recognition-on-lrs3-tedLlama-AVSR#2Word Error Rate (WER): 0.81