新篇基础2026
学会又忘掉:预训练中单样本反事实的实测
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Zachary Speck, Asa Shepard·arXiv 2608.191680 引用45 阅读
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Mamba 提出带输入选择的状态空间模型,在线性时间下沿序列过滤信息。它重新打开一个问题:注意力是否是序列建模的唯一终点。