混合专家(Mixture of Experts, MoE)是一种条件计算机制:模型将前馈层替换为多个并行的"专家"子网络,并为每个输入 token 由门控网络动态选择其中一小部分专家参与计算。这样可以在不成比例增加计算成本的前提下,大幅扩充模型的总参数量。
传统稠密模型中,每个 token 都要经过全部参数;而 MoE 让总参数与单次激活参数解耦——模型可以拥有数百亿乃至数千亿总参数,但每个 token 只激活其中一小部分。这使模型在保持较高推理效率的同时获得更强的表达能力。
MoE 已成为当前大规模模型扩展的主流方向之一,被广泛应用于 Mixtral、DeepSeek 等系列模型。以 Qwen3-235B-A22B 为例,其将每个 token 路由到 128 个专家中的 8 个,在 2350 亿总参数中激活约 220 亿参数,体现了"大总参、小激活"的典型设计。