Audio-Visual Speech Recognition based on Regulated Transformer and Spatio-Temporal Fusion Strategy for Driver Assistive Systems

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrwAVCRFormer#1Top-1 Accuracy: 98.81
lipreading-on-lip-reading-in-the-wildAVCRFormer#4Top-1 Accuracy: 89.57