feat(dqn): record Q-value, gradient norm, epoch duration, buffer size metrics
Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
This commit is contained in:
@@ -2659,6 +2659,17 @@ impl DQNTrainer {
|
||||
train_step_count as f64 / epoch_duration.as_secs_f64(),
|
||||
);
|
||||
}
|
||||
// Tier 1: RL diagnostics + training health
|
||||
training_metrics::set_q_value_stats("dqn", "current", q_mean, q_max);
|
||||
training_metrics::set_gradient_norm("dqn", "current", avg_grad_norm);
|
||||
training_metrics::set_epoch_duration("dqn", "current", epoch_duration.as_secs_f64());
|
||||
training_metrics::set_learning_rate("dqn", "current", current_lr);
|
||||
{
|
||||
let agent = self.agent.read().await;
|
||||
if let Ok(buf_size) = agent.get_replay_buffer_size() {
|
||||
training_metrics::set_replay_buffer_size("dqn", "current", buf_size as f64);
|
||||
}
|
||||
}
|
||||
|
||||
// WAVE 9-11 PRODUCTION: Track action diversity per epoch
|
||||
// Calculate active actions (used >0.5% of the time)
|
||||
|
||||
Reference in New Issue
Block a user