Tokenization Methods
Why Subword Tokenization?
Byte-Pair Encoding (BPE)
Used by: GPT-2, GPT-3, LLaMA
Algorithm: 1. Start with character vocabulary 2. Find most frequent pair 3. Merge into new token 4. Repeat until vocabulary size reached
Example: "lowest" → ["low", "est"]
WordPiece
Used by: BERT, DistilBERT
Similar to BPE but uses likelihood instead of frequency. Uses "##" prefix for continuation: "playing" → ["play", "##ing"]
SentencePiece
Tokenizer Comparison
Model | Tokenizer | Vocab Size |
|-------|-----------|------------|
GPT-4 | BPE | ~100K |
BERT | WordPiece | 30K |
LLaMA | SentencePiece | 32K |