Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks

Benchmark Model Rank Results
visual-grounding-on-refcoco-test-bFlorence-2-large-ft#1Accuracy (%): 92.0
visual-grounding-on-refcoco-testaFlorence-2-large-ft#1Accuracy (%): 95.3
visual-grounding-on-refcoco-valFlorence-2-large-ft#1Accuracy (%): 93.4