# PPO Production Training Profile [training] epochs = 100 batch_size = 64 learning_rate = 0.0001 actor_learning_rate = 0.000001 critic_learning_rate = 0.001 gamma = 0.99 [ppo] clip_epsilon = 0.2 value_loss_coef = 1.0 entropy_coef = 0.05 gae_lambda = 0.95 rollout_steps = 2048 minibatch_size = 64 max_grad_norm = 0.5 [early_stopping] enabled = true patience = 30 min_epochs_before_stopping = 50 min_value_loss_improvement_pct = 2.0 [experience] initial_capital = 1000000.0 gpu_n_episodes = 128 gpu_timesteps_per_episode = 500 avg_spread = 0.0001 accumulation_steps = 1