Cloze-driven Pretraining of Self-attention Networks

Benchmark Model Rank Results
constituency-parsing-on-penn-treebankCNN Large + fine-tuneF1 score: 95.6
named-entity-recognition-ner-on-conll-2003CNN Large + fine-tuneF1: 93.5
sentiment-analysis-on-sst-2-binaryCNN LargeAccuracy: 94.6