Loading lesson page...
Mixture of Experts (MoE)
BuildPythonA dense 70B transformer activates every parameter for every token. A 671B MoE activates only 37B per token and beats it on every benchmark. Sparsity is the most important scaling idea of the decade.