TFA on Gym Classics

 

CartPole-v0

Deep Q-Network (DQN) 3 Episodes rendered

Avg.Reward > 195 / 100 Episodes
~3min on CPU

MountainCar-v0

Deep Q-Network (DQN) 3 Episodes rendered

Trained without Reward modifications, random actions in later states with probability: e = min(1, max(0, 1-x/n))

Avg.Reward > -110.0 / 100 Episodes
~12min on CPU

Acrobot-v1

Deep Q-Network (DQN) 3 Episodes rendered

Avg.Reward > -103 / 100 Episodes
~7min on CPU

Pendulum-v0

Soft Actor Critic (SAC) 3 Episodes rendered

Avg.Reward ~ -130 / 100 Episodes
~12min on CPU

MountainCarContinuous-v0

Soft Actor Critic (SAC) 3 Episodes rendered

Avg.Reward > -110.0 / 100 Episodes
~20min on CPU

LunarLanderContinuous-v2

Soft Actor Critic (SAC) 1 Episode (Taxi Style: Outside-In)

Ongoing Style Improvement ...

LunarLanderContinuous-v2

Soft Actor Critic (SAC) 1 Episode (Soft Touch Down)

Ongoing Style Improvement ...