From a27ff8790c4fbecde0b892cb791b55d01b3cff57 Mon Sep 17 00:00:00 2001 From: jgrusewski Date: Sun, 1 Mar 2026 13:37:58 +0100 Subject: [PATCH] fix(ci): restore nvidia runtime_class_name on RL runner RL runner only handles GPU training jobs, so global nvidia runtime is safe and required (KUBERNETES_RUNTIME_CLASS_NAME override wasn't being applied). Main runner keeps overwrite-allowed pattern. Co-Authored-By: Claude Opus 4.6 --- infra/k8s/gitlab/runner-rl-values.yaml | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/infra/k8s/gitlab/runner-rl-values.yaml b/infra/k8s/gitlab/runner-rl-values.yaml index 9b2d9e048..fb0cbf79d 100644 --- a/infra/k8s/gitlab/runner-rl-values.yaml +++ b/infra/k8s/gitlab/runner-rl-values.yaml @@ -40,8 +40,8 @@ runners: memory_request_overwrite_max_allowed = "48Gi" memory_limit_overwrite_max_allowed = "48Gi" poll_timeout = 600 - # Allow CI jobs to override runtimeClassName via KUBERNETES_RUNTIME_CLASS_NAME - runtime_class_name_overwrite_allowed = ".*" + # All RL runner jobs target GPU nodes → set nvidia runtime globally + runtime_class_name = "nvidia" # Default resources for RL training on L40S cpu_request = "2000m" cpu_limit = "3800m"