Rank normalization: holding bars (reward≈0) passthrough as zero, only actual trade P&L is ranked. Preserves magnitude for trades. Q-drift: hardcoded penalty removed, E1 enrichment handles adaptively. Metrics: sharpe_raw (un-annualized per-trade) for direct comparison between training and validation. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>