diff --git a/crates/ml/src/trainers/dqn/trainer/enrichment.rs b/crates/ml/src/trainers/dqn/trainer/enrichment.rs index 5505566d2..f704ec399 100644 --- a/crates/ml/src/trainers/dqn/trainer/enrichment.rs +++ b/crates/ml/src/trainers/dqn/trainer/enrichment.rs @@ -48,7 +48,7 @@ pub(crate) struct HindsightExperience { /// Output of one enrichment cycle. #[derive(Debug, Clone)] pub(crate) struct EnrichmentResult { - /// E1: additive correction to Q-targets (clipped ±2.0). + /// E1: additive correction to Q-targets (clipped ±10.0). pub q_correction: f32, /// E2: next-epoch epsilon. pub epsilon: f32, @@ -148,7 +148,7 @@ fn compute_q_correction(trades: &[EvalTrade]) -> f32 { .map(|t| t.predicted_q - t.pnl) .sum::() / trades.len() as f32; - (-bias).clamp(-2.0, 2.0) + (-bias).clamp(-10.0, 10.0) } /// E2: Adaptive epsilon — performance-driven exploration rate.