OpenCodePapers

audio-understanding-reasoning-on-mmau

Audio Understanding Reasoning
Dataset Link
Results over time
Click legend items to toggle metrics. Hover points for model names.
Leaderboard
PaperCodeAccuracy (Avg, Test-mini)ModelNameReleaseDate
Qwen3.5-Omni Technical Report82.2Qwen3.5-Omni-Plus2026-04-21
Qwen3.5-Omni Technical Report81.1Gemini-3.1 Pro2026-04-21
Qwen3.5-Omni Technical Report80.4Qwen3.5-Omni-Flash2026-04-21
Announcing Amazon Nova 2 foundation models now available in Amazon Bedrock77.80Nova 2 Omni2026-01-01
Audio-Thinker77.70Audio-Thinker (8.4B)2025-08-11
Step-Audio-2 Technical Report77.58Step-Audio-22025-07-22
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?77.00Omni-R1 (FT on Qwen2.5-Omni, 8.2B)2025-05-14
MiMo-Audio: Audio Language Models are Few-Shot Learners✓ Link74.70MiMo-Audio (7B)2025-09-01
Audio Flamingo 373.30Audio Flamingo 3 (8.2B)2025-07-10
Step-Audio-2 Technical Report72.73Step-Audio-2-mini (8.3B)2025-07-22
Start building with Gemini 2.5 Flash71.80Gemini 2.5 Flash2025-06-17
Gemini 2.5: Our newest Gemini model with thinking71.60Gemini 2.5 Pro2025-03-25
Qwen2.5-Omni Technical Report71.50Qwen2.5-Omni (8.2B)2025-03-26
Google introduces Gemini 2.0: A new AI model for the agentic era70.50Gemini 2.0 Flash2024-12-11
Kimi-Audio Technical Report68.20Kimi-Audio (8.2B)2025-04-25
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models✓ Link67.70Audio Reasoner (8.2B)2025-02-01
Gemini 2.5 Flash-Lite is now stable and generally available66.20Gemini 2.5 Flash Lite2025-07-22
DeSTA2.5-Audio66.00DeSTA2.5-Audio (8B)2025-07-03
Phi-4 Technical Report✓ Link65.70Phi-4-multimodal (5.5B)2025-02-27
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding✓ Link64.59Audio Flamingo 2 Reasoning (FT on AF2, 3B)2025-08-01
GPT-4o System Card62.50GPT-4o Audio2024-10-01
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities✓ Link62.40Audio Flamingo 2 (3B)2025-02-06
Qwen2-Audio Technical Report59.60Qwen2-Audio-Instruct (7B)2024-07-15
Announcing Gemma 3n preview: powerful, efficient, mobile-first AI✓ Link58.00Gemma 3n (4B)2025-05-20
GPT-4o System Card53.00GPT-4o mini Audio2024-10-01
Announcing Gemma 3n preview: powerful, efficient, mobile-first AI✓ Link51.69Gemma 3n (2B)2025-05-20
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response✓ Link38.20MusiLingo (7B)2023-09-15
M2UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models✓ Link37.90M2UGen (7B)2023-08-18
SALMONN: Towards Generic Hearing Abilities for LLMs34.90SALMONN (13B)2023-10-20
MU-LLaMA: Music Understanding LLaMA27.60MuLLaMa (7B)2023-08-22
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities✓ Link22.83GAMA-IT (7B)2024-06-17
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities✓ Link20.82GAMA (7B)2024-06-17
LTU: Listen, Think, and Understand17.44LTU (7B)2023-09-01
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities✓ Link16.60Audio Flamingo Chat (1B)2024-02-02