perf: IQN quantiles 64→32 — saves 4.3GB VRAM, halves IQN GEMMs
Academic literature shows diminishing returns past 32 quantiles. 64 quantiles allocated 8.6GB for tiled intermediates (B×Q×hidden). 32 quantiles: 4.3GB (half), ~13 GEMMs halved in aux_child. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -1739,7 +1739,7 @@ pub(crate) fn dqn_default_config() -> DQNConfig {
|
||||
|
||||
// CQL + IQN (2026 modernization)
|
||||
cql_alpha: 1.0,
|
||||
iqn_num_quantiles: 64,
|
||||
iqn_num_quantiles: 32, // 64→32: saves 4.3GB VRAM, halves IQN GEMMs, diminishing returns past 32
|
||||
iqn_kappa: 1.0,
|
||||
iqn_embedding_dim: 64,
|
||||
cvar_alpha: 0.05,
|
||||
|
||||
Reference in New Issue
Block a user