Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles

Benchmark Model Rank Results
arithmetic-reasoning-on-gsm8kClaude 3.5 Sonnet (HPT)#1Accuracy: 97.72
common-sense-reasoning-on-commonsenseqaGPT-4o (HPT)#1Accuracy: 92.54
question-answering-on-boolqMistral-Nemo 12B (HPT)#1Accuracy: 99.87
text-summarization-on-samsum-corpusGPT-4o (HPT)#7ROUGE-L: 30