NEWS / 摘要
通过全局负载均衡提升混合专家模型的性能和特异化程度
来源摘要
GITHUB HUGGING FACE MODELSCOPE DISCORD 引言 混合专家模型(MoEs)通过路由机制动态并稀疏地激活模型参数,使得能高效地增大模型参数规模。基于 TopK 机制的稀疏激活会在训练中会遇到专家激活不均衡的问题:少数被频繁选择的专家会被优化得更多,进一步使得这些专家被更频繁地选择,最终导致只选择少数专家,造成剩余专家的冗余。因此,MoE 在训练中需要引入额外的辅助损失(load balance loss,LBL)来鼓励专家的选择趋于均衡。 目前主流 MoE 训练框架中 LBL 实现其实是局部的负载均衡,这使得模型需要将局部…
摘要由机器生成(来自来源站点),可能存在偏差; 本站不转载全文,请以原文为准。