BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers

Benchmark Model Rank Results
3d-object-detection-on-dair-v2x-iBEVFormer#8AP|R40(moderate): 50.7AP|R40(easy): 61.4AP|R40(hard): 50.7
3d-object-detection-on-nuscenesBEVFormer#21NDS: 0.57mAP: 0.48mATE: 0.58mASE: 0.26mAOE: 0.38mAVE: 0.38
3d-object-detection-on-nuscenes-camera-onlyBEVFormer#19NDS: 56.9Future Frame: false
bird-s-eye-view-semantic-segmentation-onBEVFormer#4IoU veh - 224x480 - Vis filter. - 100x100 at 0.5: 42.0
bird-s-eye-view-semantic-segmentation-on-lyftBEVFormer (EfficientNet-b4)#2IoU vehicle - 224x480 - Long: 44.5IoU vehicle - 224x480 - Short: 69.9
bird-s-eye-view-semantic-segmentation-on-lyftBEVFormer(ResNet-50)#6IoU vehicle - 224x480 - Long: 43.2IoU vehicle - 224x480 - Short: 68.8