| Benchmark | Model | Rank | Results |
|---|---|---|---|
| text-to-audio-retrieval-on-audiocaps | CE | #8 | R@1: 23.1±0.8R@10: 70.7±0.7 |
| text-to-audio-retrieval-on-audiocaps | MoEE | #10 | R@1: 22.5±0.3R@10: 69.5±0.9 |
| text-to-audio-retrieval-on-clotho | CE (pretraining:AudioCaps) | #7 | R@1: 9.6±0.3R@10: 40.1±0.7 |
| text-to-audio-retrieval-on-clotho | MoEE (pretraining:AudioCaps) | #8 | R@1: 8.6±0.4R@10: 39.3±0.7 |
| text-to-audio-retrieval-on-clotho | CE | #9 | R@1: 6.7±0.4R@10: 33.2±0.3 |
| text-to-audio-retrieval-on-clotho | MoEE | #12 | R@1: 6.0±0.1R@10: 32.3±0.3 |