diff --git a/crates/common/src/observability/logger.rs b/crates/common/src/observability/logger.rs index 6a98c21b3..48d1798db 100644 --- a/crates/common/src/observability/logger.rs +++ b/crates/common/src/observability/logger.rs @@ -190,7 +190,7 @@ pub fn init_json_logger(config: JsonLoggerConfig) -> CommonResult<()> { .with_target(true) .with_current_span(true) .with_span_list(false) - .with_writer(std::io::stdout)) + .with_writer(std::io::stderr)) } else { None }; diff --git a/crates/ml/src/trainers/dqn/trainer/training_loop.rs b/crates/ml/src/trainers/dqn/trainer/training_loop.rs index 4b1fa6f11..d086bde3f 100644 --- a/crates/ml/src/trainers/dqn/trainer/training_loop.rs +++ b/crates/ml/src/trainers/dqn/trainer/training_loop.rs @@ -903,7 +903,7 @@ impl DQNTrainer { state_dim, self.hyperparams.gpu_timesteps_per_episode, ); - optimal.max(32).min(256) + optimal.max(32).min(16384) } Err(_) => 256, // safe fallback } @@ -971,7 +971,7 @@ impl DQNTrainer { aligned_sd, self.hyperparams.gpu_timesteps_per_episode, ); - let chosen = optimal.max(32).min(256) as i32; // TEMP: cap at 256 to debug H100 hang + let chosen = optimal.max(32).min(16384) as i32; info!( "GPU auto-scaled n_episodes: {} (SMs={}, VRAM={:.0}MB)", chosen, hw.sm_count, hw.free_memory_mb