HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling

Benchmark Model Rank Results
prompt-engineering-on-caltech-101HPT++#2Harmonic mean: 96.96
prompt-engineering-on-dtdHPT++#3Harmonic mean: 74.23
prompt-engineering-on-eurosatHPT++#3Harmonic mean: 87.36
prompt-engineering-on-fgvc-aircraftHPT++#3Harmonic mean: 41.33
prompt-engineering-on-food-101HPT++#9Harmonic mean: 91.09
prompt-engineering-on-imagenetHPT++#6Harmonic mean: 74.24
prompt-engineering-on-imagenet-aHPT++#3Top-1 accuracy %: 51.18
prompt-engineering-on-imagenet-rHPT++#4Top-1 accuracy %: 77.52
prompt-engineering-on-imagenet-sHPT++#5Top-1 accuracy %: 49.28
prompt-engineering-on-imagenet-v2HPT++#1Top-1 accuracy %: 65.31
prompt-engineering-on-oxford-102-flowerHPT++#8Harmonic mean: 85.85
prompt-engineering-on-oxford-iiit-pet-datasetHPT++#2Harmonic mean: 96.91
prompt-engineering-on-stanford-cars-1HPT++#8Harmonic mean: 75.59
prompt-engineering-on-sun397HPT++#5Harmonic mean: 81.11
prompt-engineering-on-ucf101HPT++#3Harmonic mean: 83.81