Model-Based Offline Reinforcement Learning with Pessimism-Modulated Dynamics Belief

Benchmark Model Rank Results
d4rl-on-d4rlPMDB#1Average Reward: 88.2