Word Embeddings
From One-Hot to Dense Vectors
One-Hot Encoding:
Sparse, high-dimensional
No semantic meaning
"cat" = [1,0,0,...], "dog" = [0,1,0,...]Word Embeddings:
Dense, low-dimensional (50-300)
Capture semantic relationships
Similar words → similar vectorsWord2Vec
Skip-gram: Predict context from word
CBOW: Predict word from context
Famous example:
king - man + woman ≈ queen
GloVe (Global Vectors)
Uses co-occurrence statistics
Combines local and global context
Often performs better on analogy tasksModern Embeddings
Contextual Embeddings (BERT, GPT):
Same word gets different vectors based on context
"bank" (river) ≠ "bank" (financial)
Much more powerful than static embeddings