Files
foxhunt/WAVE43_PLANNING.md
jgrusewski 6093eac7bf 🔧 Tonic 0.14 Upgrade: Auto-generated and build system changes
Wave 64-65 cleanup: Proto regeneration and build system updates from Tonic 0.12→0.14 upgrade

Files updated:
- Cargo.lock: Dependency resolution for Tonic 0.14.2
- All build.rs: Updated for tonic-prost-build
- Proto files: Regenerated with tonic-prost 0.14
- Examples/tests: Updated for new gRPC API

🤖 Generated with [Claude Code](https://claude.com/claude-code)

Co-Authored-By: Claude <noreply@anthropic.com>
2025-10-03 07:34:26 +02:00

6.2 KiB

Wave 42: ML Test Failures - Categorized for Wave 43

Total ML Test Failures: 55 out of 571 tests (90.4% pass rate)


Failure Categories

1. Checkpoint System (11 failures)

Module: checkpoint:: Impact: Model persistence and versioning

checkpoint::integration_tests::tests::test_all_model_types_checkpoint
checkpoint::integration_tests::tests::test_checkpoint_lifecycle_management
checkpoint::integration_tests::tests::test_checkpoint_metadata_validation
checkpoint::integration_tests::tests::test_checkpoint_search_and_filtering
checkpoint::integration_tests::tests::test_checkpoint_statistics
checkpoint::integration_tests::tests::test_checkpoint_validation
checkpoint::integration_tests::tests::test_concurrent_checkpoint_operations
checkpoint::integration_tests::tests::test_latest_checkpoint_functionality
checkpoint::tests::test_checkpoint_compression
checkpoint::tests::test_list_and_cleanup_checkpoints

Priority: HIGH (affects model deployment and versioning)


2. DQN/Rainbow Agent (13 failures)

Module: dqn:: Impact: Deep Q-Learning reinforcement learning

dqn::distributional::tests::test_support_creation
dqn::dqn::tests::test_training_step_with_data
dqn::multi_step_new::test_multi_step_terminal_state
dqn::multi_step::tests::test_early_termination
dqn::multi_step::tests::test_target_computation
dqn::noisy_exploration::tests::test_exploration_efficiency_tracking
dqn::noisy_layers::tests::test_noise_reset
dqn::noisy_layers::tests::test_noisy_linear_forward
dqn::performance_tests::test_rainbow_network_performance
dqn::performance_tests::test_statistics_computation
dqn::prioritized_replay::tests::test_priority_updates
dqn::prioritized_replay::tests::test_push_and_sample

Priority: HIGH (core RL functionality)


3. MAMBA Model (9 failures)

Module: mamba:: Impact: State-space models for time series

mamba::hardware_aware::test_simd_dot_product
mamba::scan_algorithms::test_block_parallel_scan
mamba::scan_algorithms::test_financial_precision
mamba::scan_algorithms::test_parallel_prefix_scan
mamba::scan_algorithms::test_scan_operators
mamba::scan_algorithms::test_segmented_scan
mamba::scan_algorithms::test_sequential_scan
mamba::selective_state::test_importance_scoring
mamba::selective_state::test_state_importance_update
mamba::ssd_layer::tests::test_ssd_performance_metrics

Priority: MEDIUM (specialized model architecture)


4. PPO Continuous (3 failures)

Module: ppo:: Impact: Policy optimization for continuous actions

ppo::continuous_demo::tests::test_continuous_demo
ppo::continuous_demo::tests::test_integration_example
ppo::continuous_ppo::tests::test_continuous_action_selection

Priority: MEDIUM (RL policy optimization)


5. Inference Engine (3 failures)

Module: inference:: and integration:: Impact: Model prediction and serving

inference::tests::test_neural_network_batch_processing
inference::tests::test_neural_network_forward_pass
integration::inference_engine::tests::test_micro_model_forward_pass

Priority: HIGH (production inference critical)


6. Feature Engineering (3 failures)

Module: labeling:: and features:: Impact: Feature extraction and labeling

labeling::benchmarks::tests::test_full_benchmark_suite
labeling::benchmarks::tests::test_meta_labeling_benchmark
labeling::fractional_diff::tests::test_streaming_differentiator
features::tests::test_feature_extraction

Priority: MEDIUM (preprocessing pipeline)


7. TGNN - Temporal Graph Neural Network (2 failures)

Module: tgnn:: Impact: Graph-based time series modeling

tgnn::gating::tests::test_multi_head_gating
tgnn::tests::test_training_pipeline

Priority: MEDIUM (specialized architecture)


8. TFT - Temporal Fusion Transformer (2 failures)

Module: tft:: Impact: Time series forecasting

tft::quantile_outputs::tests::test_prediction_intervals
tft::quantile_outputs::tests::test_quantile_loss

Priority: MEDIUM (forecasting functionality)


9. Portfolio Transformer (2 failures)

Module: portfolio_transformer:: Impact: Portfolio optimization

portfolio_transformer::tests::test_different_model_sizes
portfolio_transformer::tests::test_portfolio_optimization

Priority: LOW (specialized use case)


10. Safety Systems (3 failures)

Module: safety:: Impact: Training safety and monitoring

safety::drift_detector::tests::test_drift_detection
safety::gradient_safety::tests::test_learning_rate_adaptation
safety::memory_manager::tests::test_safety_status

Priority: HIGH (production safety critical)


11. Utilities (4 failures)

Modules: Various support systems

batch_processing::tests::test_batch_size_auto_tuner
error_consolidated::tests::test_error_conversion_chain
test_fixtures::tests::test_generate_test_volume
universe::volatility::tests::test_integer_sqrt

Priority: LOW (utility functions)


Wave 43 Recommendation

Phase 1: Critical Production Systems (Priority: HIGH)

Target: 27 failures → 0 failures Modules:

  1. Checkpoint System (11)
  2. DQN/Rainbow Agent (13)
  3. Inference Engine (3)
  4. Safety Systems (3)

Estimated Effort: 2-3 waves Impact: Production-critical functionality

Phase 2: Model Architectures (Priority: MEDIUM)

Target: 21 failures → 0 failures Modules:

  1. MAMBA (9)
  2. PPO (3)
  3. Feature Engineering (3)
  4. TGNN (2)
  5. TFT (2)
  6. Portfolio Transformer (2)

Estimated Effort: 1-2 waves Impact: Advanced ML features

Phase 3: Utilities (Priority: LOW)

Target: 4 failures → 0 failures Modules:

  1. Batch Processing (1)
  2. Error Handling (1)
  3. Test Fixtures (1)
  4. Volatility Utils (1)

Estimated Effort: 1 wave Impact: Support systems


Success Metrics for Wave 43

  • Minimum Target: Fix all 27 high-priority failures (Phase 1)

    • Result: 95.1% → 97.3% test pass rate
  • Stretch Target: Fix all 48 high+medium priority failures (Phase 1+2)

    • Result: 95.1% → 99.3% test pass rate
  • Ideal Target: Fix all 55 failures

    • Result: 95.1% → 100% test pass rate

Generated: 2025-10-02 For: Wave 43 Planning Current Pass Rate: 90.4% (ml crate), 95.1% (workspace)