每天 06:00 自动收录的 AI 论文研究室

把新论文读成结构,把经典排成路线

Paper研究员收录 AI 奠基论文,并在每天早上 6 点从 arXiv 收入新工作。每篇都有中英双语结构化导读,以及论文里的原图。

每天 06:00 自动收录 · 最近更新 8月21日 15:16

收录
40
经典
24
新篇
16
奠基封面经典

Transformer:注意力就够了

Attention Is All You Need

这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。

NeurIPS · 2017160k 引用
本周新篇新篇

DeepSeek-R1:用强化学习把推理训出来

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。

arXiv · 20252.8k 引用

今日新收录

每天 06:00 自动收录 · 最近更新 8月21日 15:16

新篇基础2026

Lévy Attention:一次前向给出连续时间注意力的预测不确定性

Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention

Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。

Sotirios P. Chatzis, Loukas Papadoulas·arXiv 2608.191710 引用44 阅读
新篇强化学习2026

ADEPT:预训练与后训练加速高自由度灵巧操作

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。

Jayjun Lee, Jessica Yin, Asif Rana et al.·arXiv 2608.191820 引用43 阅读

经典阅读路线

从词向量走到可验证的推理模型。

完整路线
  1. 01

    词向量:把语义放进几何里

    2013

  2. 02

    AlexNet:深度卷积真正赢了一次

    2012

  3. 03

    Adam:几乎每个人都在用的优化器

    2015

  4. 04

    ResNet:让网络真正变深

    2016

  5. 05

    AlphaGo:搜索遇见深度学习

    2016

  6. 06

    Transformer:注意力就够了

    2017

  7. 07

    BERT:双向预训练改变 NLP

    2019

  8. 08

    GPT-3:上下文里的少样本学习

    2020

  9. 09

    缩放定律:损失随规模平滑下降

    2020

  10. 10

    DDPM:把生成写成逐步去噪

    2020

  11. 11

    CLIP:用自然语言监督视觉

    2021

  12. 12

    InstructGPT:让模型听人话

    2022

  13. 13

    思维链:把推理写在字面上

    2022

  14. 14

    LLaMA:开放基础模型的分水岭

    2023

  15. 15

    DPO:不用强化学习的偏好对齐

    2023

新近与高热

全部论文
新篇基础2026

Lévy Attention:一次前向给出连续时间注意力的预测不确定性

Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention

Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。

Sotirios P. Chatzis, Loukas Papadoulas·arXiv 2608.191710 引用44 阅读
新篇强化学习2026

ADEPT:预训练与后训练加速高自由度灵巧操作

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。

Jayjun Lee, Jessica Yin, Asif Rana et al.·arXiv 2608.191820 引用43 阅读
新篇大模型2025

s1:最简单的测试时缩放

s1: Simple test-time scaling

s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。

Niklas Muennighoff, Zitong Yang, Weijia Shi et al.·arXiv600 引用1.5k 阅读