Skip to content
Navigation
Dashboard
🎬Video•20 min

Train/Validation/Test Splits

Learn the critical importance of proper data splitting for model evaluation.

Data Splitting Strategy

The Three Sets

Training Set (60-80%)

  • Model learns from this data
  • Largest portion
  • Validation Set (10-20%)

  • Hyperparameter tuning
  • Model selection
  • Early stopping decisions
  • Test Set (10-20%)

  • Final evaluation only
  • Never used during training
  • Simulates real-world performance
  • Cross-Validation

    K-Fold Cross-Validation: 1. Split data into K folds 2. Train K times, each with different fold as validation 3. Average the results

    Benefits:

  • More robust evaluation
  • Uses all data for both training and validation
  • Reduces variance in estimates
  • Common Mistakes to Avoid

  • Data leakage: Test data influences training
  • Temporal leakage: Future data in training
  • Class imbalance not preserved in splits
  • 🎯 Key Takeaways

    • ✓Never train on test data
    • ✓Validation set is for tuning, test for final evaluation
    • ✓K-fold gives more robust estimates
    • ✓Preserve class balance in stratified splits