Avg.Reward > 195 / 100 Episodes
~3min on CPU
Trained without Reward modifications, random actions in later states with probability: e = min(1, max(0, 1-x/n))
Avg.Reward > -110.0 / 100 Episodes
~12min on CPU
Avg.Reward > -103 / 100 Episodes
~7min on CPU
Avg.Reward ~ -130 / 100 Episodes
~12min on CPU
Avg.Reward > -110.0 / 100 Episodes
~20min on CPU
Ongoing Style Improvement ...
Ongoing Style Improvement ...