Unleashing Text-to-Image Diffusion Models for Visual Perception

Benchmark Model Rank Results
monocular-depth-estimation-on-nyu-depth-v2VPD#18absolute relative error: 0.069RMSE: 0.254log 10: 0.030
referring-expression-segmentation-on-refcocoVPD#19Overall IoU: 73.25