DiT: Self-supervised Pre-training for Document Image Transformer

Benchmark Model Rank Results
document-image-classification-on-rvl-cdipDiT-L#17Accuracy: 92.69%Parameters: 304M
document-image-classification-on-rvl-cdipDiT-B#21Accuracy: 92.11%Parameters: 87M
document-layout-analysis-on-publaynet-valDiT-L#4Overall: 0.949Text: 0.944Title: 0.893List: 0.960Table: 0.978