| text-to-audio-retrieval-on-audiocaps | MMT | #5 | R@1: 36.1±3.3R@10: 84.5±2.0 |
| text-to-audio-retrieval-on-audiocaps | CE | #7 | R@1: 23.6± 0.6R@10: 71.4±0.5 |
| text-to-audio-retrieval-on-audiocaps | MoEE | #9 | R@1: 23.0±0.7R@10: 71.0±1.2 |
| text-to-audio-retrieval-on-clotho | MMT | #10 | R@1: 6.5±0.6R@10: 32.8±2.1 |
| text-to-audio-retrieval-on-clotho | CE(pretraining:SoundDescs) | #11 | R@1: 6.4±0.5R@10: 32.5±1.7 |
| text-to-audio-retrieval-on-sounddescs | CE | #1 | R@1: 31.1±0.2R@10: 70.8±0.5 |
| text-to-audio-retrieval-on-sounddescs | MoEE | #2 | R@1: 30.8±0.7R@10: 70.9±0.5 |
| text-to-audio-retrieval-on-sounddescs | MMT | #3 | R@1: 30.7±0.4R@10: 72.7±0.8 |
| text-to-audio-retrieval-on-sounddescs | CE(pretrained: AudioCaps) | #4 | R@1: 23.3±0.7R@10: 63.9±0.5 |