| Benchmark | Model | Rank | Results |
|---|---|---|---|
| common-sense-reasoning-on-record | KELM (finetuning RoBERTa-large based single model) | #6 | EM: 89.1F1: 89.6 |
| common-sense-reasoning-on-record | KELM (finetuning BERT-large based single model) | #10 | EM: 76.2F1: 76.7 |
| question-answering-on-copa | KELM (finetuning BERT-large based single model) | #35 | Accuracy: 78.0 |
| question-answering-on-multirc | KELM (finetuning BERT-large based single model) | #13 | F1: 70.8EM: 27.2 |