探索/大模型

新篇大模型arXiv:2405.04434

DeepSeek-V2:MLA 与经济型 MoE

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

DeepSeek-AI

arXiv · 2024

1.2k 引用 · 1.5k 阅读 · 0 收藏

摘要

提出多头潜在注意力与细粒度 MoE,在保持竞争力的同时削减 KV 缓存和训练成本。

Introduces Multi-head Latent Attention and a fine-grained MoE design to cut KV cache and training cost while remaining competitive on language benchmarks.

提要

DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。

01背景与动机

长上下文推理中,键值缓存会随序列长度线性膨胀,成为显存与带宽上的持续税负。即便模型参数量可控,服务成本仍可能被注意力状态拖垮,迫使团队在上下文长度与吞吐之间反复权衡。

DeepSeek-V2 将这一问题前移到架构层:与其只靠工程压缩或量化补救,不如让注意力本身写出更省的表示。与此同时,稠密大模型的训练账单居高不下,也推动其探索在经济约束下仍可扩展的混合专家路径。

02核心方法

多头潜在注意力(MLA)把键与值压入低维潜在向量,再按需恢复用于注意力计算,从而显著削减推理期需驻留的 KV 体积。这一设计直接针对长上下文场景的显存税,使更长窗口在相同硬件预算下更可负担。

在前馈侧,模型采用细粒度专家划分,并引入共享专家以保留通用能力;再配合面向稳定训练的路由与优化策略,使大规模 MoE 在成本约束下可落地,而不是停留在理论稀疏性。

DeepSeek-V2架构示意。MLA通过显著降低生成时的KV缓存实现高效推理;DeepSeekMoE以稀疏架构用经济成本训练强模型。
1. DeepSeek-V2架构示意。MLA通过显著降低生成时的KV缓存实现高效推理;DeepSeekMoE以稀疏架构用经济成本训练强模型。

03结果与证据

论文报告显示,该组合在语言理解与生成类基准上保持与同期强模型相当的竞争力,同时明确降低了 KV 缓存占用与训练开销。重点不在堆叠单项分数,而在于证明省缓存、省算力与可用性能可以同时成立。

证据链条主要来自架构对比与系统层面的成本观察:MLA 对应推理内存路径的改善,细粒度 MoE 对应训练与激活效率的改善。二者共同支撑「强、经济、高效」这一产品化表述,而非依赖单一技巧。

多头注意力(MHA)、分组查询注意力(GQA)、多查询注意力(MQA)与多头潜在注意力(MLA)的简化示意。MLA将键值联合压缩为潜在向量,显著减少推理时KV缓存。
2. 多头注意力(MHA)、分组查询注意力(GQA)、多查询注意力(MQA)与多头潜在注意力(MLA)的简化示意。MLA将键值联合压缩为潜在向量,显著减少推理时KV缓存。

04影响与意义

DeepSeek-V2 可视为后续 DeepSeek-V3 与 R1 等成本优势路线的前置技术:先把推理税和训练税写进结构,再放大数据与对齐收益。它对开源社区的启发,在于长上下文不必只靠更贵的硬件堆叠。

更广一点看,它强化了一种研究取向——架构创新常常首先服务账单与可部署性。当 KV 与专家粒度成为一等设计对象,后续工作更容易在开放生态中复用「可服务」的长上下文与稀疏计算思路。

“大海捞针”(NIAH)测试结果。DeepSeek-V2在长达128K的全部上下文长度上均表现良好。
3. “大海捞针”(NIAH)测试结果。DeepSeek-V2在长达128K的全部上下文长度上均表现良好。

05局限

方法实现细节密集,涉及潜在化注意力、专家划分与稳定训练等多处耦合,复现门槛明显高于普通稠密模型。缺少完整工程配套时,纸面经济性未必能平滑转化成可维护的训练与推理流水线。

生态工具、内核支持与运维经验也需要时间跟上;团队若只迁移表面结构而忽略路由稳定性与内存路径,可能难以获得预期的成本收益。因此它更适合作为系统级参考,而非即插即用的单一模块。

06要点

  1. 01KV 缓存是长上下文推理中持续存在的显存与带宽税。
  2. 02专家可以拆得很细,并与共享专家一起在经济约束下训练。
  3. 03架构创新常常首先为账单与可部署性服务,而不只是刷分。

标签

MoEMLAefficiency

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。