Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs

Benchmark Model Rank Results
speech-recognition-on-amimicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 10.69
speech-recognition-on-ami-cleanedmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 9.11
speech-recognition-on-earnings-22microsoft/Phi-4-multimodal-instructWord Error Rate (WER): 9.35
speech-recognition-on-gigaspeech-cleanedmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 7.8
speech-recognition-on-gigaspeech-testmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 7.91
speech-recognition-on-librispeech-test-cleanmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 1.35
speech-recognition-on-librispeech-test-othermicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 3.45
speech-recognition-on-spgispeechmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 2.73
speech-recognition-on-voxpopulimicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 5.77
speech-recognition-on-voxpopuli-cleanedmicrosoft/Phi-4-multimodal-instructWord Error Rate (WER): 4.18