feat(dqn): record Q-value, gradient norm, epoch duration, buffer size metrics

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
This commit is contained in:
jgrusewski
2026-03-03 00:09:58 +01:00
parent 6c7a7275de
commit 47f8c6109d

View File

@@ -2659,6 +2659,17 @@ impl DQNTrainer {
train_step_count as f64 / epoch_duration.as_secs_f64(),
);
}
// Tier 1: RL diagnostics + training health
training_metrics::set_q_value_stats("dqn", "current", q_mean, q_max);
training_metrics::set_gradient_norm("dqn", "current", avg_grad_norm);
training_metrics::set_epoch_duration("dqn", "current", epoch_duration.as_secs_f64());
training_metrics::set_learning_rate("dqn", "current", current_lr);
{
let agent = self.agent.read().await;
if let Ok(buf_size) = agent.get_replay_buffer_size() {
training_metrics::set_replay_buffer_size("dqn", "current", buf_size as f64);
}
}
// WAVE 9-11 PRODUCTION: Track action diversity per epoch
// Calculate active actions (used >0.5% of the time)