Unreasonable Effectiveness of Rule-Based Heuristics in Solving Russian SuperGLUE Tasks

Benchmark Model Rank Results
common-sense-reasoning-on-parusRandom weightedAccuracy: 0.48
common-sense-reasoning-on-parusheuristic majorityAccuracy: 0.478
common-sense-reasoning-on-parusmajority_classAccuracy: 0.498
common-sense-reasoning-on-rucosRandom weightedAverage F1: 0.25EM: 0.247
common-sense-reasoning-on-rucosheuristic majorityAverage F1: 0.26EM: 0.257
common-sense-reasoning-on-rucosmajority_classAverage F1: 0.25EM: 0.247
common-sense-reasoning-on-rwsdRandom weightedAccuracy: 0.597
common-sense-reasoning-on-rwsdheuristic majorityAccuracy: 0.669
common-sense-reasoning-on-rwsdmajority_classAccuracy: 0.669
natural-language-inference-on-lidirusRandom weightedMCC: 0
natural-language-inference-on-lidirusheuristic majorityMCC: 0.147
natural-language-inference-on-lidirusmajority_classMCC: 0
natural-language-inference-on-rcbRandom weightedAverage F1: 0.319Accuracy: 0.374
natural-language-inference-on-rcbheuristic majorityAverage F1: 0.4Accuracy: 0.438
natural-language-inference-on-rcbmajority_classAverage F1: 0.217Accuracy: 0.484
natural-language-inference-on-terraRandom weightedAccuracy: 0.483
natural-language-inference-on-terraheuristic majorityAccuracy: 0.549
natural-language-inference-on-terramajority_classAccuracy: 0.513
question-answering-on-danetqaRandom weightedAccuracy: 0.52
question-answering-on-danetqaheuristic majorityAccuracy: 0.642
question-answering-on-danetqamajority_classAccuracy: 0.503
reading-comprehension-on-musercRandom weightedAverage F1: 0.45EM: 0.071
reading-comprehension-on-musercheuristic majorityAverage F1: 0.671EM: 0.237
reading-comprehension-on-musercmajority_classAverage F1: 0.0EM: 0.0
word-sense-disambiguation-on-russeRandom weightedAccuracy: 0.528
word-sense-disambiguation-on-russeheuristic majorityAccuracy: 0.595
word-sense-disambiguation-on-russemajority_classAccuracy: 0.587