Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Benchmark Model Rank Results
code-generation-on-humanevalGemini 1.5 ProPass@1: 84.1
fs-mevqa-on-smeGemini-1.5 Pro#3BLEU-4: 41.87METEOR: 34.61ROUGE-L: 55.90CIDEr: 276.14
long-context-understanding-on-mmneedleGemini Pro 1.5#31 Image, 4*4 Stitching, Exact Accuracy: 39.85
question-answering-on-newsqaGoogle/Gemini 2.5 Pro#7EM: 68.75F1: 79.91
temporal-relation-extraction-on-vinogroundGemini-1.5-Pro (CoT)#5Text Score: 37Video Score: 27.6Group Score: 12.4
temporal-relation-extraction-on-vinogroundGemini-1.5-Pro#7Text Score: 35.8Video Score: 22.6Group Score: 10.2
video-question-answering-on-ovbenchGemini-1.5-Flash#2AVG: 50.7
video-question-answering-on-tvbenchGemini 1.5 Pro#11Average Accuracy: 47.6
visual-question-answering-on-mm-vetGemini 1.5 Pro (gemini-1.5-pro-002)#1GPT-4 score: 76.9±0.1
visual-question-answering-on-mm-vetGemini 1.5 Pro (gemini-1.5-pro)#13GPT-4 score: 65.8±0.1
visual-question-answering-on-mm-vet-v2Gemini 1.5 Pro#3GPT-4 score: 66.9±0.2
zero-shot-video-question-answer-on-video-mmeGemini 1.5 Pro#2Accuracy (%): 71.9
zero-shot-video-question-answer-on-video-mmeGemini 1.5 Flash#3Accuracy (%): 66.3
zero-shot-video-question-answer-on-video-mme-1Gemini 1.5 Pro#1Accuracy (%): 81.3
zero-shot-video-question-answer-on-video-mme-1Gemini 1.5 Flash#3Accuracy (%): 75.0
zero-shot-video-question-answer-on-vnbenchGemini#2Accuracy: 66.7
zero-shot-video-question-answer-on-zero-shotGemini 1.5 Pro#1Accuracy (% ): 66.7