EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning

Benchmark Model Rank Results
sentence-ordering-on-econlogicqaGPT-4-Turbo#1Accuracy: 0.5692
sentence-ordering-on-econlogicqaGPT-4#2Accuracy: 0.5538
sentence-ordering-on-econlogicqaGPT-3.5-Turbo#3Accuracy: 0.3769
sentence-ordering-on-econlogicqaLlama-3-8B-Instruct#4Accuracy: 0.3462
sentence-ordering-on-econlogicqaMistral-7B-Instruct-v0.2#5Accuracy: 0.3154
sentence-ordering-on-econlogicqaMistral-7B-v0.1#6Accuracy: 0.2615
sentence-ordering-on-econlogicqaMistral-7B-v0.2#7Accuracy: 0.2615
sentence-ordering-on-econlogicqaLlama-3-8B#8Accuracy: 0.2385
sentence-ordering-on-econlogicqaZephyr-7B-Alpha#9Accuracy: 0.2308
sentence-ordering-on-econlogicqaYi-6B-Chat#10Accuracy: 0.2077
sentence-ordering-on-econlogicqaZephyr-7B-Beta#11Accuracy: 0.1769
sentence-ordering-on-econlogicqaMistral-7B-Instruct-v0.1#12Accuracy: 0.1538
sentence-ordering-on-econlogicqaLlama-2-13B-Chat#13Accuracy: 0.1462
sentence-ordering-on-econlogicqaLlama-2-7B-Chat#14Accuracy: 0.0923
sentence-ordering-on-econlogicqaGemma-2B-IT#15Accuracy: 0.0846
sentence-ordering-on-econlogicqaYi-6B#16Accuracy: 0.0385
sentence-ordering-on-econlogicqaGemma-7B-IT#17Accuracy: 0.0231
sentence-ordering-on-econlogicqaLlama-2-7B#18Accuracy: 0.0077