探索

按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。

新篇基础2026

Lévy Attention:一次前向给出连续时间注意力的预测不确定性

Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention

Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。

Sotirios P. Chatzis, Loukas Papadoulas·arXiv 2608.191710 引用45 阅读
新篇强化学习2026

ADEPT:预训练与后训练加速高自由度灵巧操作

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。

Jayjun Lee, Jessica Yin, Asif Rana et al.·arXiv 2608.191820 引用44 阅读
新篇大模型2025

s1:最简单的测试时缩放

s1: Simple test-time scaling

s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。

Niklas Muennighoff, Zitong Yang, Weijia Shi et al.·arXiv600 引用1.5k 阅读
新篇大模型2024

DeepSeek-V3:开源 MoE 的新基线

DeepSeek-V3 Technical Report

V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。

DeepSeek-AI·arXiv1.5k 引用1.7k 阅读
新篇大模型2024

Mixtral:稀疏专家进入开源主流

Mixtral of Experts

Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux et al.·arXiv2.5k 引用1.5k 阅读
新篇视觉2023

SAM:把分割变成提示接口

Segment Anything

SAM 把分割从依赖预定义类别的任务,改写成可接受点、框等输入的通用提示接口。配合数据引擎与大规模掩码数据,模型能在零样本条件下为提示生成可用掩码。

Alexander Kirillov, Eric Mintun, Nikhila Ravi et al.·ICCV12k 引用1.5k 阅读
经典视觉2020

DDPM:把生成写成逐步去噪

Denoising Diffusion Probabilistic Models

DDPM 用「先加噪再学会去噪」替代 GAN 式对抗训练,以更稳的优化和更好的分布覆盖做生成。它把扩散概率模型与去噪分数匹配对齐,通过反转加噪过程实现高质量图像合成。

Jonathan Ho, Ajay Jain, Pieter Abbeel·NeurIPS22k 引用1.6k 阅读
经典大模型2020

缩放定律:损失随规模平滑下降

Scaling Laws for Neural Language Models

缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。

Jared Kaplan, Sam McCandlish, Tom Henighan et al.·arXiv12k 引用1.6k 阅读
经典基础2017

Transformer:注意力就够了

Attention Is All You Need

这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。

Ashish Vaswani, Noam Shazeer, Niki Parmar et al.·NeurIPS160k 引用1.7k 阅读
经典视觉2016

ResNet:让网络真正变深

Deep Residual Learning for Image Recognition

ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。

Kaiming He, Xiangyu Zhang, Shaoqing Ren et al.·CVPR220k 引用1.7k 阅读
经典视觉2014

GAN:生成变成一场博弈

Generative Adversarial Nets

GAN 通过生成器与判别器的对抗训练,让模型学习生成「像真的」样本,而不是最大化显式似然。它以隐含密度绕开配分函数,并深刻影响了后续生成建模与对抗学习路线。

Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza et al.·NeurIPS65k 引用1.5k 阅读