Rethinking Transfer and Auxiliary Learning for Improving Audio Captioning Transformer

Benchmark Model Rank Results
audio-captioning-on-audiocapsRethink-ACT (AST + TF + MIL)SPIDEr: 0.472CIDEr: 0.764SPICE: 0.180BLEU-4: 0.285METEOR: 0.242