A proposal for Multimodal Emotion Recognition using aural transformers and Action Units on RAVDESS dataset

Benchmark Model Rank Results
emotion-recognition-on-ravdessLogisticRegression on posteriors of xlsr-Wav2Vec2.0&bi-LSTM+Attention#1Accuracy: 86.70%
facial-emotion-recognition-on-ravdessbi-LSTM+Attention#3Accuracy: 62.13%
speech-emotion-recognition-on-ravdessxlsr-Wav2Vec2.0(FineTuning)#2Accuracy: 81.82%