diff --git a/crates/ml-alpha/examples/alpha_rl_train.rs b/crates/ml-alpha/examples/alpha_rl_train.rs index e9bb74cd0..83ace56b1 100644 --- a/crates/ml-alpha/examples/alpha_rl_train.rs +++ b/crates/ml-alpha/examples/alpha_rl_train.rs @@ -143,10 +143,9 @@ struct Cli { #[arg(long, default_value_t = 16)] n_backtests: usize, - /// PER buffer capacity (R7d). Per `replay.rs` doc, naive O(N) - /// sampling is acceptable up to ~4096. Production scale-up to - /// 100k+ needs a GPU sum-tree (R-future). - #[arg(long, default_value_t = 4096)] + /// PER buffer capacity. At b_size=16, capacity/16 = unique steps + /// retained. 32768/16 = 2048 steps of replay depth. + #[arg(long, default_value_t = 32768)] per_capacity: usize, /// Random seed pinning RNG + Xavier init + ISV controller bootstrap