新篇大模型arXiv:2401.04088
Mixtral:稀疏专家进入开源主流
Mixtral of Experts
Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux, Arthur Mensch, Blanche Savary, Chris Bamford, Devendra Singh Chaplot, Diego de las Casas, Emma Bou Hanna, Florian Bressand, Gianna Lengyel, Guillaume Bour, Guillaume Lample, Lélio Renard Lavaud, Lucile Saulnier, Marie-Anne Lachaux, Pierre Stock, Sandeep Subramanian, Sophia Yang, Szymon Antoniak, Teven Le Scao, Théophile Gervet, Thibaut Lavril, Thomas Wang, Tristan Lacroix, William El Sayed
arXiv · 2024
2.5k 引用 · 1.5k 阅读 · 0 收藏
摘要
介绍一种稀疏混合专家语言模型:每个 token 只激活 8 个专家中的 2 个,以更低的激活算力追平更密的模型。
Describes a sparse mixture-of-experts language model that activates 2 of 8 experts per token, matching denser models at lower active compute.
提要
Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。
01背景与动机
密集语言模型的质量通常随总参数一起上升,但每个 token 的前向都要跑完整套权重,推理成本几乎与规模同比例膨胀。对开源社区与中小团队而言,这往往意味着要么牺牲效果,要么承担难以承受的服务开销,质量与成本被绑在同一条陡峭曲线上。
Mixtral 试图展示另一条路径:总参数可以很大,以保留模型容量;每次前向只激活其中一小部分,以控制实际算力。这种「总参数大、激活参数小」的工作点,被定位为更可落地的质量—成本甜点,并把稀疏专家从封闭实验室重新带回开源可部署场景。
02核心方法
模型整体仍采用 Transformer 主干,但把各层的前馈网络替换为稀疏混合专家层。路由网络为每个 token 从八个专家中选出两个参与计算,其余专家在该步不激活,从而在保持较高总容量的同时降低单次前向的激活算力。
除基座外,团队还发布了开源的指令微调版本,使模型不只停留在预训练权重,也能直接用于对话与跟随指令的场景。开放权重与可部署形态并行,降低了研究者和工程团队复现、微调与上线的门槛。

03结果与证据
工作的核心主张是:在每个 token 仅激活两个专家的设定下,模型能够以更低的激活算力追平更密、每次前向更重的对照模型。总参数仍然很大,用以支撑表达能力;真正决定单步开销的是被路由选中的专家路径。
本文不编造具体榜单分数或未给出的实验数值,只保留与公开描述一致的结论框架:稀疏路由把「容量」和「激活成本」拆开,使质量—算力权衡不再完全等同于稠密放大。证据重心在机制与部署含义,而非虚构的指标表。

04影响与意义
Mixtral 让开源社区重新认真对待稀疏 MoE,而不是把它视为少数封闭实验室的内部技巧。后续 DeepSeek、Qwen、Skywork 等开源 MoE 路线在不同程度上延续了「大总参、小激活」的思路,也推动更多团队公开专家结构与训练细节。
在系统侧,它改变了推理基础设施的默认假设:服务栈需要处理专家路由、负载不均、多专家权重驻留与通信,而不能再按单一稠密矩阵的方式做调度与显存规划。模型形态与serving 设计开始一起演进。

05局限
稀疏并不自动等于省事。路由容易不均,部分专家过热、部分闲置,会损害吞吐与训练效率,需要额外的负载均衡与工程约束。即便每步只跑两个专家,全部专家权重仍常驻,显存与主机内存占用依然可观。
长上下文表现、训练稳定性以及跨设备通信开销,都要求超出稠密模型的额外工作。通信、同步与均衡是稀疏结构持续要交的「税」,不能把激活参数变少误读成端到端成本免费下降。

06要点
- 01激活参数和总参数要分开看,容量与单步算力不是同一回事。
- 02稀疏不是免费的,通信和负载均衡是必须支付的税。
- 03开源 MoE 让质量—成本曲线开始出现可部署的弯曲。
标签
相关论文
缩放定律:损失随规模平滑下降
Scaling Laws for Neural Language Models
LLaMA:开放基础模型的分水岭
LLaMA: Open and Efficient Foundation Language Models
DeepSeek-V3:开源 MoE 的新基线
DeepSeek-V3 Technical Report
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。