新篇大模型arXiv:2405.04434
DeepSeek-V2:MLA 与经济型 MoE
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-AI
arXiv · 2024
1.2k 引用 · 1.5k 阅读 · 0 收藏
摘要
提出多头潜在注意力与细粒度 MoE,在保持竞争力的同时削减 KV 缓存和训练成本。
Introduces Multi-head Latent Attention and a fine-grained MoE design to cut KV cache and training cost while remaining competitive on language benchmarks.
提要
DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。
01背景与动机
长上下文推理中,键值缓存会随序列长度线性膨胀,成为显存与带宽上的持续税负。即便模型参数量可控,服务成本仍可能被注意力状态拖垮,迫使团队在上下文长度与吞吐之间反复权衡。
DeepSeek-V2 将这一问题前移到架构层:与其只靠工程压缩或量化补救,不如让注意力本身写出更省的表示。与此同时,稠密大模型的训练账单居高不下,也推动其探索在经济约束下仍可扩展的混合专家路径。
02核心方法
多头潜在注意力(MLA)把键与值压入低维潜在向量,再按需恢复用于注意力计算,从而显著削减推理期需驻留的 KV 体积。这一设计直接针对长上下文场景的显存税,使更长窗口在相同硬件预算下更可负担。
在前馈侧,模型采用细粒度专家划分,并引入共享专家以保留通用能力;再配合面向稳定训练的路由与优化策略,使大规模 MoE 在成本约束下可落地,而不是停留在理论稀疏性。

03结果与证据
论文报告显示,该组合在语言理解与生成类基准上保持与同期强模型相当的竞争力,同时明确降低了 KV 缓存占用与训练开销。重点不在堆叠单项分数,而在于证明省缓存、省算力与可用性能可以同时成立。
证据链条主要来自架构对比与系统层面的成本观察:MLA 对应推理内存路径的改善,细粒度 MoE 对应训练与激活效率的改善。二者共同支撑「强、经济、高效」这一产品化表述,而非依赖单一技巧。

04影响与意义
DeepSeek-V2 可视为后续 DeepSeek-V3 与 R1 等成本优势路线的前置技术:先把推理税和训练税写进结构,再放大数据与对齐收益。它对开源社区的启发,在于长上下文不必只靠更贵的硬件堆叠。
更广一点看,它强化了一种研究取向——架构创新常常首先服务账单与可部署性。当 KV 与专家粒度成为一等设计对象,后续工作更容易在开放生态中复用「可服务」的长上下文与稀疏计算思路。

05局限
方法实现细节密集,涉及潜在化注意力、专家划分与稳定训练等多处耦合,复现门槛明显高于普通稠密模型。缺少完整工程配套时,纸面经济性未必能平滑转化成可维护的训练与推理流水线。
生态工具、内核支持与运维经验也需要时间跟上;团队若只迁移表面结构而忽略路由稳定性与内存路径,可能难以获得预期的成本收益。因此它更适合作为系统级参考,而非即插即用的单一模块。
06要点
- 01KV 缓存是长上下文推理中持续存在的显存与带宽税。
- 02专家可以拆得很细,并与共享专家一起在经济约束下训练。
- 03架构创新常常首先为账单与可部署性服务,而不只是刷分。
标签
相关论文
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
Mixtral:稀疏专家进入开源主流
Mixtral of Experts
DeepSeek-V3:开源 MoE 的新基线
DeepSeek-V3 Technical Report
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。