SwinMTL: A Shared Architecture for Simultaneous Depth Estimation and Semantic Segmentation from Monocular Camera Images

Benchmark Model Rank Results
monocular-depth-estimation-on-cityscapesSwinMTL#1RMSE: 5.481RMSE log: 0.139Absolute relative error (AbsRel): 0.089
multi-task-learning-on-cityscapesSwinMTL#1mIoU: 76.41RMSE: 0.51
real-time-semantic-segmentation-on-cityscapesSwinMTL#9mIoU: 76.41%
semantic-segmentation-on-cityscapesSwinMTL#59Mean IoU (class): 76.41%
semantic-segmentation-on-cityscapes-valSwinMTL#64mIoU: 76.41
semantic-segmentation-on-nyu-depth-v2SwinMTL#7Mean IoU: 58.14%