EVP: Enhanced Visual Perception using Inverse Multi-Attentive Feature Refinement and Regularized Image-Text Alignment

Benchmark Model Rank Results
depth-estimation-on-nyu-depth-v2EVP#1RMS: 0.224
monocular-depth-estimation-on-kitti-eigenEVP#12absolute relative error: 0.048RMSE: 2.015Sq Rel: 0.136
monocular-depth-estimation-on-nyu-depth-v2EVP#14absolute relative error: 0.061RMSE: 0.224log 10: 0.027
referring-expression-segmentation-on-refcoco-6EVP#3IoU: 77.61IoU (%): 77.61
referring-expression-segmentation-on-refcoco-8EVP#9Overall IoU: 78.75
referring-expression-segmentation-on-refcoco-9EVP#9Overall IoU: 72.94