探索

按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。

新篇大模型2025

s1:最简单的测试时缩放

s1: Simple test-time scaling

s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。

Niklas Muennighoff, Zitong Yang, Weijia Shi et al.·arXiv600 引用1.5k 阅读
新篇大模型2024

DeepSeek-V3:开源 MoE 的新基线

DeepSeek-V3 Technical Report

V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。

DeepSeek-AI·arXiv1.5k 引用1.7k 阅读
新篇大模型2024

Mixtral:稀疏专家进入开源主流

Mixtral of Experts

Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux et al.·arXiv2.5k 引用1.5k 阅读
经典大模型2020

缩放定律:损失随规模平滑下降

Scaling Laws for Neural Language Models

缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。

Jared Kaplan, Sam McCandlish, Tom Henighan et al.·arXiv12k 引用1.6k 阅读