专家混合是什么?
传统的大模型,每个问题都要把全部参数都「过一遍电」,像一间大办公室,任何人来办事都要惊动所有部门。专家混合(MoE),则是把模型拆成很多个「专家」小网络,每次只叫与问题最相关的几位专家出手,其他专家歇着——又快又省。它是怎么「挑专家」的?
路由器(Router)一个负责调度的「门卫」会先看一眼输入,判断该派给哪几位专家。
只激活少数专家
比如一个模型有上百个专家,每次只激活其中两三个,计算量大幅下降。
为什么这能省钱又提效?
参数多,但算得少MoE 可以拥有海量参数(知识容量大),但每次推理只用到一小部分,速度反而快。
各专家各有所长
有的专家擅长代码,有的擅长数学,各管一摊,整体能力更强。
它有什么代价?
专家越多,显存占用越大(所有专家都得存着),训练和调度也更复杂,还可能出现「负载不均」——某个专家被反复点名、累死,别的专家闲得发慌。这些都需要额外的工程去平衡。一句话记住:专家混合就是「大部队养着、小分队干活」,用少数专家的计算,撬动超大模型的能力。
评论