plan(sp11): implementation plan for reward-as-controlled-subsystem
Task-by-task plan for the SP11 spec at HEAD 9395b983c. Three layers:
Layer A (3 commits, additive infrastructure, no behavior change):
A0 — 20 ISV slots [340..360) + 20 reset entries + novelty-hash arm
A1 — 3 canary producers (val_sharpe_delta, saboteur_engagement,
reward_component_grad_ratio) with Pearls A+D chained
A2 — controller kernel + SimHash novelty buffer; HEALTH_DIAG sp11_reward
Layer B (1 atomic commit, ~750 LOC):
B1 — every consumer migrates: cf_weight (mse + c51), audit-discovered
shaping sites, saboteur multiplier, replay-time curiosity bonus,
novelty hash lookup+update scheduled at replay
Layer C (validation + close-out):
C1-C2 — local + L40S smoke; T10 3×3×50 full validation
C3-C5 — Fix 39 audit doc, pearl_reward_as_controlled_subsystem, MEMORY.md
C6 — merge to main
Plan provides exact file paths, kernel signatures, GPU oracle test
skeletons, commit messages, and validation pass criteria from spec
§9.1-9.3. ~1550 LOC total estimate; ~3 hours subagent work plus
validation wall-clock (smoke ~25 min, T10 ~4 hr).
Spec: docs/superpowers/specs/2026-05-04-sp11-reward-as-controlled-subsystem.md