OpenCodePapers

audio-tagging-on-audioset

Audio Tagging
Dataset Link
Results over time
Click legend items to toggle metrics. Hover points for model names.
Leaderboard
PaperCodemean average precisionModelNameReleaseDate
OmniVec: Learning robust representations with cross modal sharing0.552OmniVec (audio+visual)2023-11-09
OmniVec: Learning robust representations with cross modal sharing0.548OmniVec (audio-only)2023-11-09
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning✓ Link0.546EquiAV (audio-visual)2024-03-14
Contrastive Audio-Visual Masked Autoencoder✓ Link0.512CAV-MAE (Audio-Visual)2022-10-02
BEATs: Audio Pre-Training with Acoustic Tokenizers✓ Link0.506BEATs (10 models)2022-12-18
CED: Consistent ensemble distillation for audio tagging✓ Link0.500CED-Base2023-08-22
Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation✓ Link0.498mn40_as (Ensemble)2022-11-09
Efficient Training of Audio Transformers with Patchout✓ Link0.496PaSST2021-10-11
Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models✓ Link0.490DyMN-L (Audio-Only, Single)2023-10-24
HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection✓ Link0.487HTS-AT (Ensemble)2022-02-02
AST: Audio Spectrogram Transformer✓ Link0.485Audio Spectrogram Transformer2021-04-05
Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation✓ Link0.483mn40_as (Single)2022-11-09
PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation✓ Link0.474PSLA2021-02-02
Zero-shot Audio Source Separation through Query-based Learning from Weakly-labeled Data✓ Link0.467ST-SED2021-12-15
Contrastive Audio-Visual Masked Autoencoder✓ Link0.466CAV-MAE (Audio-Only)2022-10-02
ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition0.450ERANN-1-62021-06-03
Perceiver IO: A General Architecture for Structured Inputs & Outputs✓ Link0.450Perceiver IO (mel-spectrogram + video)2021-07-30
Perceiver: General Perception with Iterative Attention✓ Link0.440Perceiver (mel spectrogram + video - tuned)2021-03-04
PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition✓ Link0.431CNN142020-08-23
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning✓ Link0.324AuM-B/162024-06-05
MiDashengLM: Efficient Audio Understanding with General Audio Captions✓ Link0.089MiDashengLM-7B2025-08-06