Less is MoE:按FFN维度裁剪专家,实现更细粒度的MoE压缩
arXiv论文《Less is MoE: Trimming Experts in Domain-Specialist Language Models》指出,混合专家(MoE)模型通过条件计算获得强性能,但参数量大导致部署困难;此前的MoE压缩方法在常识推理之外的通用基准上会灾难性失效。作者将失败原因归结为压缩粒度:重要能力分散在多个专家中,却集中在FFN的稀疏中间维度上。他们采用Fisher重要性识别关键维度,效果优于基于激活值、路由分数和幅度的方案。在Qwen1.5-MoE上,仅移除135万个路由FFN中间维度中的12个,就会使GSM8K准确率崩塌,而事实知识性能基本保持。该结果提示,领域专用模型的压缩需要更细粒度的维度级裁剪,而非简单删减专家。