Attention Is All You Need

Benchmark Model Rank Results
abstractive-text-summarization-on-cnn-dailyTransformer#39ROUGE-1: 39.50ROUGE-2: 16.06ROUGE-L: 36.63
constituency-parsing-on-penn-treebankTransformer#22F1 score: 92.7
coreference-resolution-on-winograd-schemaSubword-level Transformer LM#56Accuracy: 54.1
image-guided-story-ending-generation-on-lsmdcTransformer#2BLEU-1: 15.35BLEU-2: 4.49BLEU-3: 1.82BLEU-4: 0.76CIDEr: 9.32
image-guided-story-ending-generation-on-vistTransformer#3BLEU-1: 17.18BLEU-2: 6.29BLEU-3: 3.07BLEU-4: 2.01CIDEr: 12.75
machine-translation-on-iwslt2014-germanTransformer#24BLEU score: 34.44
machine-translation-on-iwslt2015-englishTransformer#2BLEU score: 28.50
machine-translation-on-wmt2014-english-frenchTransformer Big#26BLEU score: 41.0Hardware Burden: 23G
machine-translation-on-wmt2014-english-frenchTransformer Base#38BLEU score: 38.1Hardware Burden: 23G
machine-translation-on-wmt2014-english-germanTransformer Big#37BLEU score: 28.4Hardware Burden: 871G
machine-translation-on-wmt2014-english-germanTransformer Base#43BLEU score: 27.3Operations per network pass: 330000000.0G
multimodal-machine-translation-on-multi30kTransformer#8BLUE (DE-EN): 29.0
natural-language-understanding-on-pdp60Subword-level Transformer LM#6Accuracy: 58.3
supervised-only-3d-point-cloud-classificationTransformer#11Overall Accuracy (PB_T50_RS): 77.24GFLOPs: 4.8
text-summarization-on-gigawordTransformer#20ROUGE-1: 37.57ROUGE-2: 18.90ROUGE-L: 34.69