Improving Visual Prompt Tuning for Self-supervised Vision Transformers

Benchmark Model Rank Results
visual-prompt-tuning-on-fgvcGateVPT(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)#2Mean Accuracy: 83.00
visual-prompt-tuning-on-fgvcGateVPT(ViT-B/16_MAE_pretrained_ImageNet-1K)#4Mean Accuracy: 73.39
visual-prompt-tuning-on-vtab-1k-natural-7GateVPT(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)#1Mean Accuracy: 74.84
visual-prompt-tuning-on-vtab-1k-natural-7GateVPT(ViT-B/16_MAE_pretrained_ImageNet-1K)#4Mean Accuracy: 47.61
visual-prompt-tuning-on-vtab-1k-specialized-4GateVPT(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)#1Mean Accuracy: 83.38
visual-prompt-tuning-on-vtab-1k-specialized-4GateVPT(ViT-B/16_MAE_pretrained_ImageNet-1K)#4Mean Accuracy: 76.86
visual-prompt-tuning-on-vtab-1k-structured-8GateVPT(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)#1Mean Accuracy: 49.10
visual-prompt-tuning-on-vtab-1k-structured-8GateVPT(ViT-B/16_MAE_pretrained_ImageNet-1K)#4Mean Accuracy: 36.80