Loading lesson page...
Inference Optimization
BuildPythonNo prerequisitesTwo phases define LLM inference. Prefill processes your prompt in parallel -- compute-bound. Decode generates tokens one at a time -- memory-bound. Every optimization targets one or both.