Harnessing Diffusion Models for Visual Perception with Meta Prompts

Benchmark Model Rank Results
monocular-depth-estimation-on-kitti-eigenMetaPrompt-SD#10absolute relative error: 0.047RMSE: 1.928Sq Rel: 0.125
monocular-depth-estimation-on-nyu-depth-v2MetaPrompt-SD#15absolute relative error: 0.061RMSE: 0.223log 10: 0.027
pose-estimation-on-cocoMetaPrompt-SD#2AP: 79.0
semantic-segmentation-on-ade20kMetaPrompt-SD#35Validation mIoU: 56.8
semantic-segmentation-on-cityscapesMetaPrompt-SD#2Mean IoU (class): 86.2
semantic-segmentation-on-cityscapes-valMetaPrompt-SD#3mIoU: 87.1