MMRL: Multi-Modal Representation Learning for Vision-Language Models

Benchmark Model Rank Results
prompt-engineering-on-caltech-101MMRL#4Harmonic mean: 96.68
prompt-engineering-on-dtdMMRL#4Harmonic mean: 73.82
prompt-engineering-on-eurosatMMRL#4Harmonic mean: 87.21
prompt-engineering-on-fgvc-aircraftMMRL#4Harmonic mean: 41.15
prompt-engineering-on-food-101MMRL#10Harmonic mean: 91.03
prompt-engineering-on-imagenetMMRL#3Harmonic mean: 74.45
prompt-engineering-on-imagenet-aMMRL#2Top-1 accuracy %: 51.20
prompt-engineering-on-imagenet-rMMRL#3Top-1 accuracy %: 77.53
prompt-engineering-on-imagenet-sMMRL#6Top-1 accuracy %: 49.17
prompt-engineering-on-imagenet-v2MMRL#3Top-1 accuracy %: 64.47
prompt-engineering-on-oxford-102-flowerMMRL#4Harmonic mean: 86.78
prompt-engineering-on-oxford-iiit-pet-datasetMMRL#4Harmonic mean: 96.74
prompt-engineering-on-stanford-cars-1MMRL#3Harmonic mean: 78.06
prompt-engineering-on-sun397MMRL#4Harmonic mean: 81.2
prompt-engineering-on-ucf101MMRL#2Harmonic mean: 83.89