| common-sense-reasoning-on-parus | Human Benchmark | #1 | Accuracy: 0.982 |
| common-sense-reasoning-on-parus | Baseline TF-IDF1.1 | #3 | Accuracy: 0.486 |
| common-sense-reasoning-on-rucos | Human Benchmark | #1 | Average F1: 0.93EM: 0.89 |
| common-sense-reasoning-on-rucos | Baseline TF-IDF1.1 | #3 | Average F1: 0.26EM: 0.252 |
| common-sense-reasoning-on-rwsd | Baseline TF-IDF1.1 | #1 | Accuracy: 0.662 |
| common-sense-reasoning-on-rwsd | Human Benchmark | #3 | Accuracy: 0.84 |
| natural-language-inference-on-lidirus | Human Benchmark | #1 | MCC: 0.626 |
| natural-language-inference-on-lidirus | Baseline TF-IDF1.1 | #3 | MCC: 0.06 |
| natural-language-inference-on-rcb | Human Benchmark | #1 | Average F1: 0.68Accuracy: 0.702 |
| natural-language-inference-on-rcb | Baseline TF-IDF1.1 | #3 | Average F1: 0.301Accuracy: 0.441 |
| natural-language-inference-on-terra | Human Benchmark | #1 | Accuracy: 0.92 |
| natural-language-inference-on-terra | Baseline TF-IDF1.1 | #3 | Accuracy: 0.471 |
| question-answering-on-danetqa | Human Benchmark | #1 | Accuracy: 0.915 |
| question-answering-on-danetqa | Baseline TF-IDF1.1 | #3 | Accuracy: 0.621 |
| reading-comprehension-on-muserc | Human Benchmark | #2 | Average F1: 0.806EM: 0.42 |
| reading-comprehension-on-muserc | Baseline TF-IDF1.1 | #3 | Average F1: 0.587EM: 0.242 |
| word-sense-disambiguation-on-russe | Human Benchmark | #1 | Accuracy: 0.805 |
| word-sense-disambiguation-on-russe | Baseline TF-IDF1.1 | #2 | Accuracy: 0.57 |