GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data
Open paper
Benchmark
Model
Rank
Results
multi-task-language-understanding-on-mmlu
GPT-4 o1(300b)
–
Average (%): 87
question-answering-on-newsqa
OpenAI/GPT-4o
–
EM: 70.21
F1: 81.74
Rank counts only results with a code link.