Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models

Benchmark Model Rank Results
adversarial-robustness-on-advglueDeBERTa (single model)#1Accuracy: 0.6086
adversarial-robustness-on-advglueALBERT (single model)#2Accuracy: 0.5922
adversarial-robustness-on-advglueT5 (single model)#3Accuracy: 0.5682
adversarial-robustness-on-advglueSMART_RoBERTa (single model)#4Accuracy: 0.5371
adversarial-robustness-on-advglueFreeLB (single model)#5Accuracy: 0.5048
adversarial-robustness-on-advglueRoBERTa (single model)#6Accuracy: 0.5021
adversarial-robustness-on-advglueInfoBERT (single model)#7Accuracy: 0.4603
adversarial-robustness-on-advglueELECTRA (single model)#8Accuracy: 0.4169
adversarial-robustness-on-advglueBERT (single model)#9Accuracy: 0.3369
adversarial-robustness-on-advglueSMART_BERT (single model)#10Accuracy: 0.3029