探索/大模型

新篇大模型arXiv:2401.04088

Mixtral:稀疏专家进入开源主流

Mixtral of Experts

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux, Arthur Mensch, Blanche Savary, Chris Bamford, Devendra Singh Chaplot, Diego de las Casas, Emma Bou Hanna, Florian Bressand, Gianna Lengyel, Guillaume Bour, Guillaume Lample, Lélio Renard Lavaud, Lucile Saulnier, Marie-Anne Lachaux, Pierre Stock, Sandeep Subramanian, Sophia Yang, Szymon Antoniak, Teven Le Scao, Théophile Gervet, Thibaut Lavril, Thomas Wang, Tristan Lacroix, William El Sayed

arXiv · 2024

2.5k 引用 · 1.5k 阅读 · 0 收藏

摘要

介绍一种稀疏混合专家语言模型:每个 token 只激活 8 个专家中的 2 个,以更低的激活算力追平更密的模型。

Describes a sparse mixture-of-experts language model that activates 2 of 8 experts per token, matching denser models at lower active compute.

提要

Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。

01背景与动机

密集语言模型的质量通常随总参数一起上升,但每个 token 的前向都要跑完整套权重,推理成本几乎与规模同比例膨胀。对开源社区与中小团队而言,这往往意味着要么牺牲效果,要么承担难以承受的服务开销,质量与成本被绑在同一条陡峭曲线上。

Mixtral 试图展示另一条路径:总参数可以很大,以保留模型容量;每次前向只激活其中一小部分,以控制实际算力。这种「总参数大、激活参数小」的工作点,被定位为更可落地的质量—成本甜点,并把稀疏专家从封闭实验室重新带回开源可部署场景。

02核心方法

模型整体仍采用 Transformer 主干,但把各层的前馈网络替换为稀疏混合专家层。路由网络为每个 token 从八个专家中选出两个参与计算,其余专家在该步不激活,从而在保持较高总容量的同时降低单次前向的激活算力。

除基座外,团队还发布了开源的指令微调版本,使模型不只停留在预训练权重,也能直接用于对话与跟随指令的场景。开放权重与可部署形态并行,降低了研究者和工程团队复现、微调与上线的门槛。

混合专家层。路由器将每个输入向量分配给8个专家中的2个;层输出为所选两专家输出的加权和。在Mixtral中,专家为与标准Transformer相同的前馈块。
1. 混合专家层。路由器将每个输入向量分配给8个专家中的2个;层输出为所选两专家输出的加权和。在Mixtral中,专家为与标准Transformer相同的前馈块。

03结果与证据

工作的核心主张是:在每个 token 仅激活两个专家的设定下,模型能够以更低的激活算力追平更密、每次前向更重的对照模型。总参数仍然很大,用以支撑表达能力;真正决定单步开销的是被路由选中的专家路径。

本文不编造具体榜单分数或未给出的实验数值,只保留与公开描述一致的结论框架:稀疏路由把「容量」和「激活成本」拆开,使质量—算力权衡不再完全等同于稠密放大。证据重心在机制与部署含义,而非虚构的指标表。

混合专家层。路由器将每个输入向量分配给8个专家中的2个;层输出为所选两专家输出的加权和。在Mixtral中,专家为与标准Transformer相同的前馈块。
2. 混合专家层。路由器将每个输入向量分配给8个专家中的2个;层输出为所选两专家输出的加权和。在Mixtral中,专家为与标准Transformer相同的前馈块。

04影响与意义

Mixtral 让开源社区重新认真对待稀疏 MoE,而不是把它视为少数封闭实验室的内部技巧。后续 DeepSeek、Qwen、Skywork 等开源 MoE 路线在不同程度上延续了「大总参、小激活」的思路,也推动更多团队公开专家结构与训练细节。

在系统侧,它改变了推理基础设施的默认假设:服务栈需要处理专家路由、负载不均、多专家权重驻留与通信,而不能再按单一稠密矩阵的方式做调度与显存规划。模型形态与serving 设计开始一起演进。

Mixtral与不同Llama模型在多项基准上的表现。所有模型均经统一评估流程重测以便准确比较。Mixtral在全部基准上优于或持平Llama 2 70B,尤其在数学与代码生成上显著领先。
3. Mixtral与不同Llama模型在多项基准上的表现。所有模型均经统一评估流程重测以便准确比较。Mixtral在全部基准上优于或持平Llama 2 70B,尤其在数学与代码生成上显著领先。

05局限

稀疏并不自动等于省事。路由容易不均,部分专家过热、部分闲置,会损害吞吐与训练效率,需要额外的负载均衡与工程约束。即便每步只跑两个专家,全部专家权重仍常驻,显存与主机内存占用依然可观。

长上下文表现、训练稳定性以及跨设备通信开销,都要求超出稠密模型的额外工作。通信、同步与均衡是稀疏结构持续要交的「税」,不能把激活参数变少误读成端到端成本免费下降。

Mistral(7B/8x7B)与Llama 2(7B/13B/70B)在MMLU、常识推理、世界知识与阅读理解、数学和代码上的结果。Mixtral以约1/5激活参数在几乎所有基准上大幅超越Llama 2 70B(阅读理解除外),在代码与数学上亦显著更优。
4. Mistral(7B/8x7B)与Llama 2(7B/13B/70B)在MMLU、常识推理、世界知识与阅读理解、数学和代码上的结果。Mixtral以约1/5激活参数在几乎所有基准上大幅超越Llama 2 70B(阅读理解除外),在代码与数学上亦显著更优。

06要点

  1. 01激活参数和总参数要分开看,容量与单步算力不是同一回事。
  2. 02稀疏不是免费的,通信和负载均衡是必须支付的税。
  3. 03开源 MoE 让质量—成本曲线开始出现可部署的弯曲。

标签

MoEopen-source

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。