KILT: a Benchmark for Knowledge Intensive Language Tasks

Benchmark Model Rank Results
entity-linking-on-kilt-aida-yago2T5-base#2KILT-AC: 74.05R-Prec: 74.05Recall@5: 74.05Accuracy: 74.05
entity-linking-on-kilt-wned-cwebT5-base#2KILT-AC: 49.29R-Prec: 49.29Recall@5: 49.29Accuracy: 49.29
entity-linking-on-kilt-wned-wikiT5-base#2KILT-AC: 47.13R-Prec: 47.13Recall@5: 47.13Accuracy: 47.13
fact-verification-on-kilt-feverRAG#2KILT-AC: 53.45R-Prec: 61.94Recall@5: 75.55Accuracy: 86.31
fact-verification-on-kilt-feverT5-base#3KILT-AC: 0.0R-Prec: 0.0Recall@5: 0.0Accuracy: 76.3
open-domain-dialog-on-kilt-wizard-ofT5-base#2KILT-RL: 0.0R-Prec: 0.0Recall@5: 0.0ROUGE-L: 12.4F1: 13.53
open-domain-question-answering-on-kiltT5-base#2KILT-EM: 0.0R-Prec: 0.0Recall@5: 0.0EM: 19.6F1: 27.73
open-domain-question-answering-on-kilt-2T5-base#2KILT-EM: 0.0R-Prec: 0.0Recall@5: 0.0EM: 18.11F1: 27.83
open-domain-question-answering-on-kilt-eli5T5-base#2KILT-RL: 0.0R-Prec: 0.0Recall@5: 0.0ROUGE-L: 19.08F1: 16.1
question-answering-on-kilt-eli5T5-base#4Rouge-L: 19.08F1: 16.1
question-answering-on-kilt-eli5BART+DPR#5Rouge-L: 17.41F1: 17.88
question-answering-on-kilt-eli5RAG#6Rouge-L: 14.05F1: 14.51
slot-filling-on-kilt-t-rexT5-base#3KILT-AC: 0.0R-Prec: 0.0Recall@5: 0.0Accuracy: 43.56F1: 50.61
slot-filling-on-kilt-zero-shot-reT5-base#2KILT-AC: 0.0R-Prec: 0.0Recall@5: 0.0Accuracy: 9.02F1: 13.52