探索/基础

新篇基础arXiv:2608.19168

学会又忘掉:预训练中单样本反事实的实测

Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

Zachary Speck, Asa Shepard

arXiv 2608.19168 · 2026

0 引用 · 45 阅读 · 0 收藏

摘要

单条训练样本对成品模型的贡献通常只能估计,因为直接测量需要两次仅差一个 batch 中一行的完整预训练。作者在小规模上把该反事实重复 24 次:32 个从零训练的 124M GPT-2,四条件×八种子,OpenWebText。在 9536 步中第 200 步、峰值学习率处,将 256 行 batch 中一行替换为含 194 token 段落的固定注入。注入后约 50 步,见过段落的臂在段落上比未见臂低 0.039 与 0.044 nats 交叉熵(八种子均显著);最终步则未检出该差异。

A single training example's contribution to a finished model is normally estimated rather than measured, because measuring it takes two expensive full pre-training runs that differ in one row of one batch. We ran that counterfactual 24 times at a small scale. We trained 32 GPT-2 models at 124M parameters from scratch on OpenWebText, over four conditions and eight seeds. At step 200 of 9,536, at peak learning rate, we replaced one row of a 256-row batch with a fixed context injection carrying a 194-token passage. The three injected conditions are: 1. fluent prose with a corpus-attested subject, 2. fluent prose with a fabricated subject matched to it within 0.14% on full-batch gradient delta, and 3. random keyboard characters. The fourth condition is an uninjected twin. The passage is learned from one exposure and then decays. Fifty steps after injection, the arm that saw a passage predicts it better than the arm that did not by 0.039 and 0.044 nats of cross-entropy on the passage, at eight of eight seeds with p < $10^{-4}$. At the final step we do not detect that difference for either passage, at p = 0.25 and p = 0.71, against minimum detectable effects of 0.025 and 0.079 nats, n

提要

作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。

01背景与动机

理解单条训练数据如何改变预训练模型,通常只能依赖影响函数等估计,因为金标准是两次仅差一个 batch 中一行的完整训练,成本极高。直接测量因此很少被采用,多数工作只能给出终点附近的间接归因分数。

作者选择在可控小规模上支付这一成本,直接跑该反事实,并跟踪“是否学到”与“是否保留到结束”的时间过程,而不是只报告最终归因。目标是把单样本贡献从静态分数还原为可观测的学习—衰减轨迹。

02核心方法

共训练 32 个 124M GPT-2,从零开始于 OpenWebText,覆盖四条件与八个随机种子。总步数为 9536;在第 200 步、峰值学习率处,将 256 行 batch 中的一行替换为固定 context injection,内含 194 token 段落。

三个注入条件分别为:流畅且语料可证主题的散文;流畅但伪造主题、全 batch 梯度 delta 匹配在 0.14% 内的散文;以及随机键盘字符。第四条件为未注入孪生 run。学习与遗忘通过注入臂与未注入臂在该段落上的交叉熵对比读出。

03结果与证据

注入后约 50 步,见过段落的臂相对未见臂在段落上交叉熵优势为 0.039 与 0.044 nats,八个种子均达到 p < 10^{-4}。这表明单次暴露即可在短期内可测地写入模型。

到最终步,两段注入均未检出该差异(p = 0.25 与 p = 0.71),对照最小可检测效应 0.025 与 0.079 nats。结果支持“先学会、后衰减至检测不到”的时间结构,而非终点仍稳定保留。

04影响与意义

该工作提供少见的真反事实、多种子证据:预训练中单样本影响可以是短暂的。它对数据归因、记忆与遗忘,以及如何解释最终模型中单点数据贡献的方法论构成直接约束。

尤其重要的是,终点不可见不等于中途从未学习。若只在训练结束做归因,可能系统性地低估或误判单条样本曾经产生的作用,从而影响对数据价值与记忆机制的判断。

05局限

实验尺度为 124M,注入窗口较短,结果未必直接外推到更大模型或更长数据寿命。检测力受多种子方差与最小可检测效应限制,无法排除更微弱的残留效应。

随机字符与梯度匹配条件说明控制严格,但现实网页数据混合更为复杂。摘要与正文均未声称存在普遍适用的遗忘定律,结论应限定在本设定的测量范围之内。

06要点

  1. 01单 batch 行替换的完整预训练反事实在 32 个 124M 模型上被重复测量。
  2. 02注入后约 50 步,段落交叉熵优势约为 0.039–0.044 nats 且高度显著。
  3. 03训练终点未检出该优势,呈现出在检测限度内“先学会后丢失”的时间结构。

标签

pretrainingcounterfactualmemorizationdata influence

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。