Florence: A New Foundation Model for Computer Vision

Benchmark Model Rank Results
action-classification-on-kinetics-600Florence (curated FLD-900M pretrain)#20Top-1 Accuracy: 87.8Top-5 Accuracy: 97.9
action-recognition-in-videos-on-kinetics-400-1Florence#1Top-1 Accuracy: 86.5Top-5 Accuracy: 97.3
cross-modal-retrieval-on-coco-2014Florence#9Text-to-image R@1: 63.2Text-to-image R@5: 85.7Image-to-text R@1: 81.8
image-classification-on-imagenetFlorence-CoSwin-H#9Top 1 Accuracy: 90.05%Number of params: 893MTop 5 Accuracy: 99.02
object-detection-on-cocoFlorence-CoSwin-H#19box mAP: 62.4
object-detection-on-coco-minivalFlorence-CoSwin-H#17box AP: 62
video-retrieval-on-msr-vtt-1kaFlorence#36text-to-video R@1: 37.6text-to-video R@5: 63.8
visual-question-answering-on-vqa-v2-test-dev-1Florence#7Accuracy: 80.16
visual-question-answering-on-vqa-v2-test-std-1Florence#3overall: 80.36
zero-shot-cross-modal-retrieval-on-coco-2014Florence#11Image-to-text R@1: 64.7Image-to-text R@5: 85.9Text-to-image R@1: 47.2
zero-shot-cross-modal-retrieval-on-flickr30kFlorence#9Image-to-text R@1: 90.9Image-to-text R@5: 99.1Text-to-image R@1: 76.7
zero-shot-video-retrieval-on-msr-vttFlorence#15text-to-video R@1: 37.6text-to-video R@5: 63.8