{ "ppo": { "best_objective": -10.562240600585938, "best_params": { "clip_epsilon": 0.1937704475953032, "entropy_coeff": 0.004575857121380468, "policy_learning_rate": 0.0009063277596553022, "value_learning_rate": 0.00008412342994353697, "value_loss_coeff": 1.3082900521181515 }, "elapsed_secs": 4.173037206, "trials": 6 } }