Vision Transformers for Dense Prediction

Benchmark Model Rank Results
monocular-depth-estimation-on-eth3dDPT#7Delta < 1.25: 0.0946absolute relative error: 0.078
monocular-depth-estimation-on-kitti-eigenDPT-Hybrid#34absolute relative error: 0.062RMSE: 2.573RMSE log: 0.092
monocular-depth-estimation-on-nyu-depth-v2DPT-Hybrid#49absolute relative error: 0.110RMSE: 0.357log 10: 0.045
semantic-segmentation-on-ade20kDPT-Hybrid#136Validation mIoU: 49.02
semantic-segmentation-on-ade20k-valDPT-Hybrid#58mIoU: 49.02Pixel Accuracy: 83.11
semantic-segmentation-on-pascal-contextDPT-Hybrid#9mIoU: 60.46