Task 9d: Q-mean EMA drift penalty (lambda=0.01) in C51 grad kernel. Prevents +0.47 Q-mean drift observed in train-vpb4w. Task 9e: 500-step LR warmup for new tensor groups (regime gate, adaptive atoms, Mamba2, multi-horizon). Prevents gradient shock on new components introduced to trained network. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>