Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training

Benchmark Model Rank Results
visual-navigation-on-room-to-roomPrevalent#8spl: 0.51