新篇基础arXiv:2608.19171
Lévy Attention:一次前向给出连续时间注意力的预测不确定性
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Sotirios P. Chatzis, Loukas Papadoulas
arXiv 2608.19171 · 2026
0 引用 · 45 阅读 · 0 收藏
摘要
面向不规则采样时间序列的深度模型可在任意连续时刻作答,但通常不说明可信程度。Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分:query-key 相容性构成连续(时间×通道)强度,输出在抽样原子上平均插值 value。期望下退化为经 mollify 的余弦核注意力,可精确反传;Poisson 构造闭式保留证据质量 Λ_q 与 value 分歧 tr Σ_V(q),并给出作为采样算子均方根偏差的不确定性 σ̂(q)。
Deep models for irregularly-sampled time series answer queries at arbitrary continuous timestamps, yet report nothing about how far each answer should be trusted. We show the attention layer itself can close that gap: with the right stochastic formulation, the pass that makes each prediction also reports, in closed form and at no extra cost, how far it should be trusted. We introduce Lévy Attention, a cross-attention operator whose output is a stochastic integral against an inhomogeneous Poisson random measure: query-key compatibilities assemble an intensity over a continuous (time x channel) index space, the measure scatters atoms under it, and the output averages an interpolated value field at those atoms. In expectation it reduces to a mollified cosine-kernel attention, so it replaces a softmax layer and trains with exact gradients. What softmax discards, the Poisson construction preserves in closed form: the evidence $Λ_q$ (total compatibility mass) and the disagreement $\mathrm{tr}\,Σ_V(q)$ (value spread). An exact variance identity makes their combination $\hatσ(q)=\sqrt{\mathrm{tr}\,Σ_V(q)\,\varphi(Λ_q)}$ the root-mean-square deviation of the sampled operator, emitted by the
提要
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
01背景与动机
不规则采样时间序列上的深度模型需要在任意连续时间戳回答查询,但标准注意力与 softmax 前向只给出点估计,不报告该估计应被信任到何种程度。这一缺口在医疗监测、传感器融合等需要校准置信的应用中尤为突出,单纯点预测难以支撑稳健决策。
若不确定性依赖额外采样或外挂预测头,不仅增加计算开销,也与注意力机制本身脱节,难以解释证据从何而来。作者希望在同一注意力通路内,以闭式方式同时给出预测与可信度,使信任度量成为算子的内生输出而非事后附加。
02核心方法
Lévy Attention 将交叉注意力定义为对非齐次 Poisson 随机测度的随机积分。query-key 相容性在连续的(时间×通道)指标空间上组装强度,该测度按强度撒布原子,输出在这些原子处对插值后的 value 场取平均,从而把注意力推广到连续时间设定。
在期望意义下,该算子退化为经 mollify 的余弦核注意力,因此可直接替换 softmax 并用精确梯度训练。Poisson 构造闭式保留 softmax 所丢弃的证据质量 Λ_q 与 value 分歧 tr Σ_V(q);由精确方差恒等式得到 σ̂(q)=√(tr Σ_V(q)·φ(Λ_q)),即采样算子的均方根偏差,并在产生预测的同一次前向中输出。
03结果与证据
理论方面,工作将所报告的不确定性与采样算子的方差对齐,并保证期望算子仍是可训练的 mollified 核注意力,从而在替换 softmax 时不牺牲端到端优化路径。摘要强调不确定性以闭式给出,且无额外前向或采样成本。
所给摘要与笔记未包含具体数据集上的数值分数,也未列出与基线方法的定量对比。因此此处仅陈述其理论主张与机制性质,不引入未经提供的实验数字或性能排名。
04影响与意义
该方法为连续时间与不规则时间序列注意力提供了内生的预测不确定性接口,把传统点估计注意力扩展为同时携带证据质量与 value 分歧解释的随机算子。下游模块可直接读取 σ̂(q),用于调节置信或触发更为保守的策略。
在需要校准置信而非仅依赖点估计的决策场景中,这种与注意力通路绑定的不确定性通道有助于把模型输出与风险管理衔接起来,而无需另建一套与主网络脱节的置信估计流水线。
05局限
所报告的不确定性含义绑定于该 Poisson 注意力模型的方差恒等式,表示采样算子的均方根偏差,未必直接等同于完整贝叶斯后验宽度或经校准的频率覆盖。强度构造、mollify 方式以及 φ(·) 的选择都会影响数值标定效果。
摘要未展示系统性的误校准分析,也未给出与额外采样或外挂头方案的详细计算开销对比;这些内容需参阅全文,才能评估实际部署中的标定质量与效率权衡。
06要点
- 01交叉注意力被写成对非齐次 Poisson 随机测度的随机积分。
- 02期望下等价于可训练的 mollified 余弦核注意力,可替换 softmax。
- 03Λ_q 与 tr Σ_V(q) 经方差恒等式组合为单次前向的闭式 σ̂(q)。
标签
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。