Not all layers are equally as important: Every Layer Counts BERT

Benchmark Model Rank Results
linguistic-acceptability-on-colaELC-BERT-base 98MAccuracy: 82.6
linguistic-acceptability-on-colaELC-BERT-small 24MAccuracy: 76.1
linguistic-acceptability-on-colaLTG-BERT-base 98MAccuracy: 82.7
linguistic-acceptability-on-colaLTG-BERT-small 24MAccuracy: 77.6
natural-language-inference-on-multinliELC-BERT-base 98M (zero init)Matched: 84.4Mismatched: 84.5
natural-language-inference-on-multinliELC-BERT-small 24MMatched: 79.2Mismatched: 79.9
natural-language-inference-on-multinliLTG-BERT-base 98MMatched: 83Mismatched: 83.4
natural-language-inference-on-multinliLTG-BERT-small 24MMatched: 78Mismatched: 78.8
natural-language-inference-on-rteELC-BERT-base 98M (zero init)Accuracy: 63
natural-language-inference-on-rteELC-BERT-small 24MAccuracy: 55.4
natural-language-inference-on-rteLTG-BERT-base 98MAccuracy: 54.7
natural-language-inference-on-rteLTG-BERT-small 24MAccuracy: 53.7