hyperopt_baseline_rl uses --output (JSON file path), while train_baseline_rl uses --output-dir (checkpoint directory). Split arg generation by preset. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
hyperopt_baseline_rl uses --output (JSON file path), while train_baseline_rl uses --output-dir (checkpoint directory). Split arg generation by preset. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>