探索

按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。

经典大模型2020

缩放定律:损失随规模平滑下降

Scaling Laws for Neural Language Models

缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。

Jared Kaplan, Sam McCandlish, Tom Henighan et al.·arXiv12k 引用1.6k 阅读