The GPT SeriesGPT-1 (2018) 117M parameters Proved unsupervised pre-training works Fine-tuned for downstream tasksGPT-2 (2019) 1.5B parameters "Too dangerous to release" (initially) Zero-shot capabilities emerged Trained on WebText (40GB)GPT-3 (2020) 175B parameters Few-shot learning without fine-tuning In-context learning API-based access (ChatGPT foundation)GPT-4 (2023) Multimodal (text + images) Much better reasoning 100K+ context length (GPT-4 Turbo) Powers ChatGPT PlusKey InnovationsScaling Laws: More parameters → Better performance More data → Better performance Predictable improvement with scaleEmergent Capabilities: Abilities that appear at scale Not present in smaller models Chain-of-thought reasoning