- New ensemble_reduce_kernel.cu: fused sigmoid→mean→weighted-sum in one kernel, single block, thread-per-model. Pure f32, no bf16. - build.rs: nvcc compilation without --use_fast_math - aggregate_logits_gpu: loads cubin, uploads raw f32 buffers, launches kernel, reads back single scalar. No GpuTensor/ActivationKernels. - Removed aggregate_logits_cpu (dead code, GPU-only system) - ml-explainability: removed unreachable dead code after stub return, prefixed unused vars. Zero warnings. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
3.4 KiB
3.4 KiB