diff --git a/config/training/dqn-production.toml b/config/training/dqn-production.toml index ae3f39a20..2b3aaec08 100644 --- a/config/training/dqn-production.toml +++ b/config/training/dqn-production.toml @@ -82,7 +82,7 @@ q_clip_max = 50.0 n_steps = 5 tau = 0.005 c51_warmup_epochs = 5 -c51_alpha_max = 1.0 +c51_alpha_max = 0.5 her_ratio = 0.2 cql_alpha = 1.0 curiosity_weight = 0.1 diff --git a/crates/ml/src/trainers/dqn/config.rs b/crates/ml/src/trainers/dqn/config.rs index d8c9fc1a7..9a80a3f4c 100644 --- a/crates/ml/src/trainers/dqn/config.rs +++ b/crates/ml/src/trainers/dqn/config.rs @@ -1865,7 +1865,7 @@ impl DQNHyperparameters { // C51 warmup: use MSE loss for first 5 epochs (stronger gradient than C51 cross-entropy) c51_warmup_epochs: 5, - c51_alpha_max: 1.0, // Default: pure C51 after warmup. Hyperopt can search [0.3, 0.9]. + c51_alpha_max: 0.5, // MSE always contributes 50%. Hyperopt searches [0.3, 0.9]. // Decision Transformer pre-training: disabled by default dt_pretrain_epochs: 0, // 0 = disabled