探索/大模型

新篇大模型arXiv:2608.19181

GC-OPD:用组校准对齐长上下文推理中的教师与验证器

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao

arXiv 2608.19181 · 2026

0 引用 · 46 阅读 · 0 收藏

摘要

On-policy distillation(OPD)用教师的稠密 token 级信号在学生自生成回复上训练,但在长上下文中可能偏向局部合理却遗漏分散证据或违反全局约束的回复。任务验证器在回复级评估完成度并可给部分分。作者在两类长上下文证据聚合任务上诊断:输入变长时轨迹级 OPD 分与验证器奖励越来越不对齐。GC-OPD 在 rollout 组内分别归一化二者,以其差作为教师–验证器分歧残差,再用 RACA 按相对 OPD 优势把残差分到 token,同时保留原 OPD 信号。

On-policy distillation (OPD) trains a student on its own responses using dense token-level guidance from a stronger teacher. In long-context tasks, however, token-level teacher support can favor locally plausible responses that omit evidence distributed across the input or violate global task constraints. Task-specific verifiers, in contrast, evaluate task completion at the response level and may return graded rewards that reflect partial success. We diagnose this mismatch on fixed responses from two representative long-context evidence-aggregation tasks. Across longer input ranges, trajectory-level OPD scores become progressively less aligned with verifier rewards, indicating teacher-verifier disagreement. Motivated by this observation, we introduce Group-Calibrated On-Policy Distillation (GC-OPD). GC-OPD separately normalizes verifier rewards and trajectory-level OPD scores within each rollout group and uses their difference as a signed teacher-verifier disagreement residual. Relative-advantage-based credit assignment (RACA) distributes this trajectory-level residual across tokens according to their relative OPD advantages while preserving the original OPD signal. Across five lon

提要

长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。

01背景与动机

On-policy distillation(OPD)让学生在自身生成轨迹上接受更强教师的稠密 token 级指导,训练信号密集、样本利用效率高。然而在长上下文证据聚合任务中,局部 token 似然往往只反映“读起来合理”,未必保证模型真正汇聚分散证据,或满足全局任务约束。

任务验证器从回复级评估完成度,并可给出反映部分成功的分级奖励。问题在于:教师轨迹分与验证器奖励并不自动一致。若只最大化教师 likelihood,学生可能学到局部流畅却全局不合格的行为,因此需要显式处理这种教师–验证器错位。

02核心方法

作者先在两类代表性长上下文证据聚合任务的固定回复上做诊断:随着输入长度区间增大,轨迹级 OPD 分与验证器奖励的对齐逐渐变差,表明教师支持与任务完成度之间的分歧在加长上下文中更突出。

GC-OPD 在每个 rollout 组内分别归一化验证器奖励与轨迹级 OPD 分,以其差作为有符号的教师–验证器分歧残差。RACA 再按 token 的相对 OPD 优势把该轨迹级残差分配到各 token,同时保留原始 OPD 信号,从而在不丢掉稠密教师指导的前提下注入任务级校准。

两项证据聚合任务(多表抽取MTE与高召回检索HRR)中的教师–验证器分歧。成对分歧率刻画排序冲突,OPD偏好差距刻画沿验证器排序的OPD偏好方向与幅度。二者均表明输入越长对齐越弱。详见第3.2节。
1. 两项证据聚合任务(多表抽取MTE与高召回检索HRR)中的教师–验证器分歧。成对分歧率刻画排序冲突,OPD偏好差距刻画沿验证器排序的OPD偏好方向与幅度。二者均表明输入越长对齐越弱。详见第3.2节。

03结果与证据

诊断结果支持核心动机:在更长的输入区间上,轨迹级 OPD 与验证器奖励的不一致加剧,说明仅依赖教师 likelihood 难以稳定刻画长上下文全局正确性。方法随后在五个长上下文相关设定上评估;所给摘要在任务列表处截断,未提供完整指标表。

因此,本文可确认的证据链主要是概念与流程层面的:先揭示长度相关的教师–验证器错位,再通过组内校准得到分歧残差,最后用相对优势把残差落到 token。具体数值比较需以原文完整实验为准,此处不外推未给出的分数。

GC-OPD概览。GC-OPD计算组归一化验证器奖励与轨迹级OPD分数,形成其带符号残差,并用RACA将残差分配到各响应token,同时保留原始OPD优势。
2. GC-OPD概览。GC-OPD计算组归一化验证器奖励与轨迹级OPD分数,形成其带符号残差,并用RACA将残差分配到各响应token,同时保留原始OPD优势。

04影响与意义

工作表明,在长上下文推理蒸馏中,仅最大化教师 token likelihood 不足以约束分散证据使用与全局约束满足。把回复级验证信号重新嵌回 token 级 on-policy 训练,是缓解“局部像、全局错”的一条可操作路径。

对需要证据聚合、跨段一致性或可部分打分任务的长上下文对齐与蒸馏而言,组校准残差加相对优势归因提供了清晰的方法模板:保留教师稠密监督,同时用验证器校正轨迹级目标偏差。

17,265 token案例的固定rollout示意可视化。复现所选上下文证据与八条独立重采样的学生响应;原始标签为B。
3. 17,265 token案例的固定rollout示意可视化。复现所选上下文证据与八条独立重采样的学生响应;原始标签为B。

05局限

GC-OPD 依赖可用的任务验证器,以及能够支持组内归一化的合理 rollout 分组;若验证信号噪声大或分组不当,残差方向可能不稳定。RACA 的分配质量也受相对 OPD 优势估计影响,优势不准会削弱残差归因。

所给摘要未完整展示全部任务数值、消融与失败案例,因此跨任务幅度与稳健性尚不能从摘要单独判定。对无分级奖励、验证器很稀疏或不可微设定的泛化程度,需要对照原文细节进一步确认。

06要点

  1. 01长上下文下,轨迹级 OPD 分与验证器奖励会随输入变长而错位。
  2. 02GC-OPD 在 rollout 组内分别归一化二者,并用其差作为有符号的教师–验证器分歧残差。
  3. 03RACA 按相对 OPD 优势将轨迹残差分配到 token,同时保留原始 OPD 信号。

标签

on-policy distillationlong-contextcalibrationreasoning

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。