Task 1: Reward rank normalization kernel (SNR amplification) Task 2: Q-gap momentum for spread gradient (plateau modulation) Task 3: H100 integration test (50 epochs, compare to train-w6qfd) Layers 3+4 (dir→mag conditioning, variance sizing) deferred to separate plan after L1+L2 validation. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>