探索/大模型

新篇大模型arXiv:2412.19437

DeepSeek-V3:开源 MoE 的新基线

DeepSeek-V3 Technical Report

DeepSeek-AI

arXiv · 2024

1.5k 引用 · 1.7k 阅读 · 0 收藏

摘要

报告一个总参数 6710 亿、激活约 370 亿的 MoE 模型,以相对经济的训练成本在多项基准上追平领先闭源模型。

Reports a 671B-parameter MoE model with 37B activated parameters, trained economically, matching leading closed models on many benchmarks.

提要

V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。

01背景与动机

闭源前沿模型在综合能力上树立了较高门槛,开源工作往往因训练配方不完整或算力预算过高而难以追赶。DeepSeek-V3 试图缩小这一差距,把先前分散的架构成果整理成一条可执行、可规模化的预训练路径,而不是停留在单点论文模块。

具体而言,工作把 MLA、DeepSeekMoE、无辅助损失的负载均衡以及多 token 预测打包成一套可执行配方。动机很务实:证明经过仔细工程化的开源 MoE,不必对标闭源实验室的全量算力,也能进入第一梯队质量区间。

02核心方法

模型采用大规模混合专家结构,总参数约 6710 亿,每个 token 激活约 370 亿参数。预训练结合 DeepSeekMoE 路由与多头潜在注意力以控制显存和算力,并引入多 token 预测作为辅助训练目标。

与算法同等重要的是一套稳定的 FP8 训练栈,用以支撑大规模、长时间预训练的数值可靠性。报告强调:数值格式、无需辅助损失的负载均衡以及系统层工程,与模型结构本身同样关键,共同构成可落地的完整训练方案。

DeepSeek-V3基本架构示意。沿用DeepSeek-V2,采用MLA与DeepSeekMoE以实现高效推理与经济训练。
1. DeepSeek-V3基本架构示意。沿用DeepSeek-V2,采用MLA与DeepSeekMoE以实现高效推理与经济训练。

03结果与证据

在一系列常规基准上,DeepSeek-V3 被报告为在多项任务上追平领先闭源模型,同时训练预算相对更经济。激活参数量远小于总参数量,这正是 MoE 设计所追求的效率折中,而非单纯堆叠稠密计算。

技术报告将训练成本、运行稳定性与质量表现并列讨论,而不是只突出某一个汇总分数。任务层面的对比细节需要读者自行查阅公开表格与评测协议;本文仅概括报告结论,不编造或转述未经独立核实的具体分数。

采用FP8数据格式的整体混合精度框架;为清晰起见仅展示Linear算子。
2. 采用FP8数据格式的整体混合精度框架;为清晰起见仅展示Linear算子。

04影响与意义

DeepSeek-V3 直接成为后续 R1 的基座模型,其预训练选择因此延续到偏推理的后训练阶段。它也改变了 2025 年开源社区的默认对标对象:强开源基座被期待在多数公开评测上接近闭源前沿。

这一释放强化了一个判断:一旦开源基础模型足够强,下游后训练与社区衍生工作会迅速铺开并形成生态。成本可控的 MoE 训练配方由此成为社区共享的参照路径,而不再只是少数机构才能掌握的内部优势。

(a) 提出细粒度量化以减轻特征异常值导致的量化误差(为简化仅示Fprop)。(b) 结合该策略,每隔N_C=128个元素将MMA提升至CUDA Core做高精度累加,从而提升FP8 GEMM精度。
3. (a) 提出细粒度量化以减轻特征异常值导致的量化误差(为简化仅示Fprop)。(b) 结合该策略,每隔N_C=128个元素将MMA提升至CUDA Core做高精度累加,从而提升FP8 GEMM精度。

05局限

报告仍不是一份完整可复现的数据清单;数据配比、过滤规则与精确训练日程等关键信息,并未细到足以支持比特级复现的程度。因此,公开评测协议是否足够严格、结果是否受到污染影响,都需要第三方开展独立核实。

与其他大模型技术报告类似,在外部复现实验与数据污染审计跟上之前,基准上的领先应被谨慎解读。该工作更主要的是记录一条可借鉴的工程与算法结合路径,而不是提供一次完整透明的开源数据集发布。

“大海捞针”(NIAH)测试结果。DeepSeek-V3在长达128K的全部上下文长度上均表现良好。
4. “大海捞针”(NIAH)测试结果。DeepSeek-V3在长达128K的全部上下文长度上均表现良好。

06要点

  1. 01成本曲线可以被工程折弯。
  2. 02负载均衡不必总靠辅助损失。
  3. 03开源基座一旦够强,后训练会迅速开花。

标签

MoEopen-sourcetraining

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。