Skip to content
Navigation
Dashboard
📖Reading•15 min

Xavier Initialization

Understand why proper weight initialization is crucial.

Weight Initialization

Why It Matters

Poor initialization leads to:

  • Vanishing gradients (weights too small)
  • Exploding gradients (weights too large)
  • Slow convergence
  • Xavier/Glorot Initialization

    For sigmoid/tanh activations: W ~ Normal(0, √(2/(nᵢₙ + nₒᵤₜ)))

    He Initialization (Kaiming)

    For ReLU activations: W ~ Normal(0, √(2/nᵢₙ))

    Guidelines

    Activation | Initialization |
    |------------|---------------|
    Sigmoid, Tanh | Xavier |
    ReLU | He (Kaiming) |
    GELU | He |

    🎯 Key Takeaways

    • ✓Proper initialization prevents gradient issues
    • ✓Xavier for sigmoid/tanh, He for ReLU
    • ✓Scale weights based on layer sizes
    • ✓Modern techniques reduce initialization sensitivity

    📚 Additional Resources