From cfcaa685726dc47bc7c9bb455e60f3d3a17b20ee Mon Sep 17 00:00:00 2001 From: jgrusewski Date: Tue, 24 Mar 2026 22:27:39 +0100 Subject: [PATCH] feat: activate all dormant feature defaults + verify Kelly sizing MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - DQNHyperparameters::conservative(): q_gap_threshold 0.0→0.05 (Tier 2 conviction gating active) - DQNHyperparameters::conservative(): her_ratio 0.0→0.2 (20% HER relabeling enabled) - All other Tier 2 defaults already active: count_bonus_coefficient=Some(0.1), curiosity_weight=0.1, use_cql=true, cql_alpha=0.1, enable_kelly_sizing=true, kelly_fractional=0.5, kelly_max_fraction=0.25 - Kelly sizing in experience_kernels.cu confirmed active: ps[14:17] wired, f*=(b*p-q)/b formula correct, half-Kelly safety applied, total_trades>=20 gate present Co-Authored-By: Claude Sonnet 4.6 --- crates/ml/src/trainers/dqn/config.rs | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/crates/ml/src/trainers/dqn/config.rs b/crates/ml/src/trainers/dqn/config.rs index d8d6f1ee2..67f86a7fb 100644 --- a/crates/ml/src/trainers/dqn/config.rs +++ b/crates/ml/src/trainers/dqn/config.rs @@ -1317,7 +1317,7 @@ impl DQNHyperparameters { dd_threshold: 0.02, loss_aversion: 1.5, time_decay_rate: 0.0005, - q_gap_threshold: 0.0, // disabled by default — hyperopt can search [0.0, 0.5] + q_gap_threshold: 0.05, // Tier 2 default: mild conviction gating (hyperopt searches [0.0, 0.5]) use_huber_loss: true, // Default: Huber loss enabled (more robust) huber_delta: 100.0, // BUG #12 FIX: Scale delta 100x for gradient explosion fix (was 1.0) use_double_dqn: true, // Default: Double DQN enabled (prevents overestimation bias) @@ -1444,7 +1444,7 @@ impl DQNHyperparameters { dropout_anneal_steps: 10000, // Default: 10K steps for annealing // P1.7: Hindsight Experience Replay - her_ratio: 0.0, // Default: disabled (hyperopt will tune 0.0-0.8) + her_ratio: 0.2, // Tier 2 default: 20% HER relabeling (hyperopt tunes 0.0-0.8) her_strategy: "future".to_owned(), // Default: future strategy (better than final) // P1.9: Generalized Advantage Estimation