jgrusewski
eabc7ae36b
feat: Phase 3 reward tuning — fix dynamics+architecture, search 7 reward dims
Three-phase hyperopt pipeline:
Phase 1 (fast): fix architecture + reward, search dynamics (~17D)
Phase 2 (full): fix dynamics, search architecture (~5D)
Phase 3 (reward): fix dynamics + architecture, search reward weights (7D)
Phase 3 is the fastest (~10s/trial) since only experience collection
changes. CLI: --phase reward --hyperopt-params phase2_results.json
Argo template runs all 3 phases sequentially. Phase 2 writes to
_phase2_results.json, Phase 3 writes final _hyperopt_results.json.
Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>