Files
foxhunt/crates
jgrusewski a2fde27d09 feat: experience collector — PORTFOLIO_STRIDE=12, composite reward kernel args
Update GpuExperienceCollector for 8-component composite reward:
- PORTFOLIO_STRIDE=12 const (separate from PPO's PORTFOLIO_STATE_SIZE=8)
- Portfolio buffer allocation: 3 -> 12 floats per episode
- peak_equity and prev_equity init to initial_capital (not zero)
- Kernel launch: replace hold_reward with 7 reward weights + eta +
  features buffer pointer + market_dim
- ExperienceCollectorConfig: replace hold_reward with 7 reward fields,
  remove use_dsr (DSR always enabled via w_dsr weight)
- Training loop: map DQNHyperparameters reward fields to config

Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
2026-03-22 20:50:53 +01:00
..