diff --git a/crates/ml-alpha/src/trainer/integrated.rs b/crates/ml-alpha/src/trainer/integrated.rs index 2327f4b69..23523f4ec 100644 --- a/crates/ml-alpha/src/trainer/integrated.rs +++ b/crates/ml-alpha/src/trainer/integrated.rs @@ -2687,7 +2687,7 @@ impl IntegratedTrainer { // [-1, +1] span as the canonical floor — the ratchet // in `rl_reward_clamp_controller` only grows magnitude. (crate::rl::isv_slots::RL_REWARD_CLAMP_WIN_INDEX, 1.0), - (crate::rl::isv_slots::RL_REWARD_CLAMP_LOSS_INDEX, 3.0), + (crate::rl::isv_slots::RL_REWARD_CLAMP_LOSS_INDEX, 1.5), (crate::rl::isv_slots::RL_REWARD_CLAMP_MARGIN_INDEX, 1.5), (crate::rl::isv_slots::RL_REWARD_CLAMP_RATIO_INDEX, 3.0), (crate::rl::isv_slots::RL_REWARD_CLAMP_CLIP_RATE_TARGET_INDEX, 0.05),