c51_loss_kernel: float gamma → const float* gamma_buf [B]. fill_gamma_buf kernel: broadcasts base_gamma * gamma_mod[0] to [B]. gamma_mod from isv_forward ∈ [0.5, 1.0] → effective_gamma ∈ [base_gamma*0.5, base_gamma]. Model learns its own planning horizon. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>