新篇强化学习arXiv:2608.19182
ADEPT:预训练与后训练加速高自由度灵巧操作
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff
arXiv 2608.19182 · 2026
0 引用 · 44 阅读 · 0 收藏
摘要
ADEPT 是面向高自由度机器人、可 sim-to-real 迁移的大规模 RL 框架,直接从原始视触感知求解长程任务。先在通用物体重摆放任务上预训练灵巧策略,再以后验行为为先验做下游后训练,避免从零发现难技能并重复学习共性阶段。朴素微调会破坏重摆放零样本能力,故采用行为克隆蒸馏、critic 预热与保守 on-policy 更新;关节空间 Geometric Fabric 在策略与机器人间调解以安全利用运动学灵巧性,并将教师蒸馏为感知学生做零样本真机迁移。
We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception. ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task. The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: a 23 Do
提要
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
01背景与动机
高自由度多指机器人上的长程灵巧操作,往往难以仅靠从零开始的强化学习发现:探索空间巨大,接触丰富,成功信号稀疏。与此同时,许多下游任务共享重摆放、抓稳与姿态调整等共性子技能,若每个任务都重新学习,训练成本高且不稳定。
因此需要可迁移的行为先验,并在微调阶段尽量保住预训练能力;还要在发挥全关节运动学灵巧性的同时保证执行安全,并支持直接从原始视觉与触觉输入出发、可从仿真迁移到真机的策略学习流程。
02核心方法
ADEPT 先在通用物体重摆放(reposing)任务上大规模预训练灵巧策略,再将该行为作为下游后训练的先验,使新任务不必从零发现难技能,也避免重复学习相同阶段。针对朴素 RL 微调会迅速破坏重摆放零样本能力的问题,后训练采用行为克隆蒸馏、critic 预热与保守 on-policy 更新的组合配方以稳住迁移。
为安全利用高自由度运动学,方法引入关节空间 Geometric Fabric,在 RL 策略输出与机器人底层控制之间进行调解。后训练得到的教师策略再被蒸馏为依赖视触感知的学生策略,用于零样本 sim-to-real 部署。

03结果与证据
摘要指出,预训练策略能够零样本完成下游任务中的重摆放阶段,说明通用 reposing 先验可以覆盖多任务共享的操作前段。稳定后训练配方被用于缓解迁移过程中的能力退化,使下游学习不必以牺牲已有重摆放能力为代价。
在迁移与部署方面,感知学生在两种机器人 embodiment 上实现零样本 sim-to-real,摘要提及其中包含约 23 DoF 量级的高自由度设定。所给材料未列全具体成功率等完整实验数字,因此本文仅陈述摘要中明确给出的定性结论。

04影响与意义
ADEPT 将高自由度灵巧操作拆解为可复用的预训练先验与注重保真的后训练两个阶段,降低了多指长程任务从零探索的难度,也减少了为每个新任务重复学习共性技能的开销。
同时,它把视触感知下的 sim-to-real 组织成一套可工程化的训练配方:先验获取、稳定微调、运动学调解与教师到学生蒸馏相互衔接,为后续在更多 embodiment 与长程接触任务上扩展提供了清晰路径。

05局限
方法仍依赖仿真中通用重摆放任务对下游接触分布的覆盖程度;若下游出现显著差异的物体、摩擦或接触模式,先验收益可能下降。Geometric Fabric 调解与保守更新有助于稳定与安全,但也可能限制策略追求极限敏捷或非常规运动的能力。
此外,所给摘要对真机失败模式、触觉传感假设、标定与延迟条件,以及大规模预训练与后训练的计算成本着墨有限,完整边界条件仍需结合全文实验与硬件细节进一步评估。
06要点
- 01通用物体重摆放预训练可为高自由度多指操作提供可迁移的灵巧行为先验。
- 02行为克隆蒸馏、critic 预热与保守 on-policy 更新共同用于稳住后训练、缓解预训练能力退化。
- 03关节空间 Geometric Fabric 调解策略与机器人执行,并支撑感知学生的零样本 sim-to-real 蒸馏。
标签
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。