Add GpuDqnTrainer::apply_c51_budget_scale() which runs scale_f32_ungraphed on grad_buf immediately after submit_forward_ops_main (C51 backward) and before CQL/IQN SAXPYs in submit_aux_ops. Final master gradient is now a weighted sum: c51_budget×C51 + cql_budget×CQL + iqn_budget×IQN. Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>