探索

按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。

新篇大模型2025

s1:最简单的测试时缩放

s1: Simple test-time scaling

s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。

Niklas Muennighoff, Zitong Yang, Weijia Shi et al.·arXiv600 引用1.5k 阅读
新篇大模型2024

DeepSeek-V3:开源 MoE 的新基线

DeepSeek-V3 Technical Report

V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。

DeepSeek-AI·arXiv1.5k 引用1.7k 阅读
新篇大模型2024

Mixtral:稀疏专家进入开源主流

Mixtral of Experts

Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux et al.·arXiv2.5k 引用1.5k 阅读