BEiT: BERT Pre-Training of Image Transformers

Benchmark Model Rank Results
document-image-classification-on-rvl-cdipBEiT-B#22Accuracy: 91.09%Parameters: 87M
document-layout-analysis-on-publaynet-valBEiT-B#7Overall: 0.931Text: 0.934Title: 0.866List: 0.924Table: 0.973
image-classification-on-imagenetBEiT-L (ViT; ImageNet-22K pretrain)#35Top 1 Accuracy: 88.60%Number of params: 331M
image-classification-on-imagenetBEiT-L (ViT; ImageNet 1k pretrain)#152Top 1 Accuracy: 86.3%Number of params: 86M
image-classification-on-omnibenchmarkBeiT#22Average Top-1 Accuracy: 30.1
self-supervised-image-classification-on-1BEiT-L (ViT)#14Top 1 Accuracy: 86.3%Number of Params: 307M
self-supervised-image-classification-on-1BEiT-B (ViT)#29Top 1 Accuracy: 84.6%Number of Params: 86M
semantic-segmentation-on-ade20kBEiT-L (ViT+UperNet)#33Validation mIoU: 57.0
semantic-segmentation-on-ade20k-valBEiT-L (ViT+UperNet, ImageNet-22k pretrain)#21mIoU: 57.0