GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data

Benchmark Model Rank Results
multi-task-language-understanding-on-mmluGPT-4 o1(300b)Average (%): 87
question-answering-on-newsqaOpenAI/GPT-4oEM: 70.21F1: 81.74