AI From Scratch/Phase 07/Lesson 11/~45 minutes

Mixture of Experts (MoE)

BuildPython

A dense 70B transformer activates every parameter for every token. A 671B MoE activates only 37B per token and beats it on every benchmark. Sparsity is the most important scaling idea of the decade.

Loading lesson page...