The Llama 3 Herd of Models

Benchmark Model Rank Results
answerability-prediction-on-peerqaLlama-3-IT-8B-8k#3Macro F1: 0.3112
answerability-prediction-on-peerqaLlama-3-IT-8B-32k#5Macro F1: 0.2881
multi-task-language-understanding-on-mmluDBRX Instruct 132B (5-shot)#3Average (%): 73.7
multi-task-language-understanding-on-mmluLlama 3.1 8B (CoT)#5Average (%): 73.0
question-answering-on-peerqaLlama-3-IT-8B-32k#3Prometheus-2 Answer Correctness: 3.1673Rouge-L: 0.2286
question-answering-on-peerqaLlama-3-IT-8B-8k#4Prometheus-2 Answer Correctness: 3.1102Rouge-L: 0.2295