Learning General Purpose Distributed Sentence Representations via Large Scale Multi-task Learning

Benchmark Model Rank Results
natural-language-inference-on-multinliGenSen#39Matched: 71.4Mismatched: 71.3
paraphrase-identification-on-quora-questionGenSen#21Accuracy: 87.01
semantic-textual-similarity-on-mrpcGenSen#29Accuracy: 78.6%F1: 84.4%