Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

Benchmark Model Rank Results
openai-gym-on-ant-v4SAC#3Average Return: 5208.09
openai-gym-on-halfcheetah-v4SAC#1Average Return: 15836.04
openai-gym-on-hopper-v4SAC#3Average Return: 2882.56
openai-gym-on-humanoid-v4SAC#2Average Return: 6211.50
openai-gym-on-walker2d-v4SAC#1Average Return: 5745.27