Large Language Models are Strong Audio-Visual Speech Recognition Learners
Open paper
Benchmark
Model
Rank
Results
audio-visual-speech-recognition-on-lrs3-ted
Llama-AVSR
#3
Word Error Rate (WER): 0.77
speech-recognition-on-lrs3-ted
Llama-AVSR
#2
Word Error Rate (WER): 0.81
Rank counts only results with a code link.