AI From Scratch/Phase 10/Lesson 12/~120 minutes

Inference Optimization

BuildPythonNo prerequisites

Two phases define LLM inference. Prefill processes your prompt in parallel -- compute-bound. Decode generates tokens one at a time -- memory-bound. Every optimization targets one or both.

Loading lesson page...