新篇大模型arXiv:2412.19437
DeepSeek-V3:开源 MoE 的新基线
DeepSeek-V3 Technical Report
DeepSeek-AI
arXiv · 2024
1.5k 引用 · 1.7k 阅读 · 0 收藏
摘要
报告一个总参数 6710 亿、激活约 370 亿的 MoE 模型,以相对经济的训练成本在多项基准上追平领先闭源模型。
Reports a 671B-parameter MoE model with 37B activated parameters, trained economically, matching leading closed models on many benchmarks.
提要
V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。
01背景与动机
闭源前沿模型在综合能力上树立了较高门槛,开源工作往往因训练配方不完整或算力预算过高而难以追赶。DeepSeek-V3 试图缩小这一差距,把先前分散的架构成果整理成一条可执行、可规模化的预训练路径,而不是停留在单点论文模块。
具体而言,工作把 MLA、DeepSeekMoE、无辅助损失的负载均衡以及多 token 预测打包成一套可执行配方。动机很务实:证明经过仔细工程化的开源 MoE,不必对标闭源实验室的全量算力,也能进入第一梯队质量区间。
02核心方法
模型采用大规模混合专家结构,总参数约 6710 亿,每个 token 激活约 370 亿参数。预训练结合 DeepSeekMoE 路由与多头潜在注意力以控制显存和算力,并引入多 token 预测作为辅助训练目标。
与算法同等重要的是一套稳定的 FP8 训练栈,用以支撑大规模、长时间预训练的数值可靠性。报告强调:数值格式、无需辅助损失的负载均衡以及系统层工程,与模型结构本身同样关键,共同构成可落地的完整训练方案。

03结果与证据
在一系列常规基准上,DeepSeek-V3 被报告为在多项任务上追平领先闭源模型,同时训练预算相对更经济。激活参数量远小于总参数量,这正是 MoE 设计所追求的效率折中,而非单纯堆叠稠密计算。
技术报告将训练成本、运行稳定性与质量表现并列讨论,而不是只突出某一个汇总分数。任务层面的对比细节需要读者自行查阅公开表格与评测协议;本文仅概括报告结论,不编造或转述未经独立核实的具体分数。

04影响与意义
DeepSeek-V3 直接成为后续 R1 的基座模型,其预训练选择因此延续到偏推理的后训练阶段。它也改变了 2025 年开源社区的默认对标对象:强开源基座被期待在多数公开评测上接近闭源前沿。
这一释放强化了一个判断:一旦开源基础模型足够强,下游后训练与社区衍生工作会迅速铺开并形成生态。成本可控的 MoE 训练配方由此成为社区共享的参照路径,而不再只是少数机构才能掌握的内部优势。

05局限
报告仍不是一份完整可复现的数据清单;数据配比、过滤规则与精确训练日程等关键信息,并未细到足以支持比特级复现的程度。因此,公开评测协议是否足够严格、结果是否受到污染影响,都需要第三方开展独立核实。
与其他大模型技术报告类似,在外部复现实验与数据污染审计跟上之前,基准上的领先应被谨慎解读。该工作更主要的是记录一条可借鉴的工程与算法结合路径,而不是提供一次完整透明的开源数据集发布。

06要点
- 01成本曲线可以被工程折弯。
- 02负载均衡不必总靠辅助损失。
- 03开源基座一旦够强,后训练会迅速开花。
标签
相关论文
Mixtral:稀疏专家进入开源主流
Mixtral of Experts
DeepSeek-V2:MLA 与经济型 MoE
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
LLaMA:开放基础模型的分水岭
LLaMA: Open and Efficient Foundation Language Models
DeepSeek-R1:用强化学习把推理训出来
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。