探索/强化学习

新篇强化学习arXiv:2608.19182

ADEPT:预训练与后训练加速高自由度灵巧操作

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff

arXiv 2608.19182 · 2026

0 引用 · 44 阅读 · 0 收藏

摘要

ADEPT 是面向高自由度机器人、可 sim-to-real 迁移的大规模 RL 框架,直接从原始视触感知求解长程任务。先在通用物体重摆放任务上预训练灵巧策略,再以后验行为为先验做下游后训练,避免从零发现难技能并重复学习共性阶段。朴素微调会破坏重摆放零样本能力,故采用行为克隆蒸馏、critic 预热与保守 on-policy 更新;关节空间 Geometric Fabric 在策略与机器人间调解以安全利用运动学灵巧性,并将教师蒸馏为感知学生做零样本真机迁移。

We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception. ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task. The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: a 23 Do

提要

ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。

01背景与动机

高自由度多指机器人上的长程灵巧操作,往往难以仅靠从零开始的强化学习发现:探索空间巨大,接触丰富,成功信号稀疏。与此同时,许多下游任务共享重摆放、抓稳与姿态调整等共性子技能,若每个任务都重新学习,训练成本高且不稳定。

因此需要可迁移的行为先验,并在微调阶段尽量保住预训练能力;还要在发挥全关节运动学灵巧性的同时保证执行安全,并支持直接从原始视觉与触觉输入出发、可从仿真迁移到真机的策略学习流程。

02核心方法

ADEPT 先在通用物体重摆放(reposing)任务上大规模预训练灵巧策略,再将该行为作为下游后训练的先验,使新任务不必从零发现难技能,也避免重复学习相同阶段。针对朴素 RL 微调会迅速破坏重摆放零样本能力的问题,后训练采用行为克隆蒸馏、critic 预热与保守 on-policy 更新的组合配方以稳住迁移。

为安全利用高自由度运动学,方法引入关节空间 Geometric Fabric,在 RL 策略输出与机器人底层控制之间进行调解。后训练得到的教师策略再被蒸馏为依赖视触感知的学生策略,用于零样本 sim-to-real 部署。

ADEPT实现高自由度臂手机器人的仿真到真实强化学习,完成伸取、抓取、抬起、重定向、搬运、对齐与插入。在23自由度Kuka-Allegro(两路RGB相机)与29自由度Flexiv-Sharpa(两路RGB相机与五个指尖触觉传感器)上验证。
1. ADEPT实现高自由度臂手机器人的仿真到真实强化学习,完成伸取、抓取、抬起、重定向、搬运、对齐与插入。在23自由度Kuka-Allegro(两路RGB相机)与29自由度Flexiv-Sharpa(两路RGB相机与五个指尖触觉传感器)上验证。

03结果与证据

摘要指出,预训练策略能够零样本完成下游任务中的重摆放阶段,说明通用 reposing 先验可以覆盖多任务共享的操作前段。稳定后训练配方被用于缓解迁移过程中的能力退化,使下游学习不必以牺牲已有重摆放能力为代价。

在迁移与部署方面,感知学生在两种机器人 embodiment 上实现零样本 sim-to-real,摘要提及其中包含约 23 DoF 量级的高自由度设定。所给材料未列全具体成功率等完整实验数字,因此本文仅陈述摘要中明确给出的定性结论。

ADEPT概览。(1) 在通用重定位任务上用PPO预训练(π_pre, V_pre)。(2) 经BC蒸馏、冻结演员-评论家预热与保守PPO,后训练得到面向下游富接触任务的(π_post, V_post)。(3) 将π_post蒸馏为立体RGB学生策略π_student。(4) 在真实机器人上零样本部署π_student。
2. ADEPT概览。(1) 在通用重定位任务上用PPO预训练(π_pre, V_pre)。(2) 经BC蒸馏、冻结演员-评论家预热与保守PPO,后训练得到面向下游富接触任务的(π_post, V_post)。(3) 将π_post蒸馏为立体RGB学生策略π_student。(4) 在真实机器人上零样本部署π_student。

04影响与意义

ADEPT 将高自由度灵巧操作拆解为可复用的预训练先验与注重保真的后训练两个阶段,降低了多指长程任务从零探索的难度,也减少了为每个新任务重复学习共性技能的开销。

同时,它把视触感知下的 sim-to-real 组织成一套可工程化的训练配方:先验获取、稳定微调、运动学调解与教师到学生蒸馏相互衔接,为后续在更多 embodiment 与长程接触任务上扩展提供了清晰路径。

真实世界设置。(A) 23自由度Kuka-Allegro与29自由度Flexiv-Sharpa平台,各配备两台RealSense RGB相机(左与中)。(B) FMB销钉与板、盘子与碗架。(C) 真实测试中使用的多样初始状态与光照。
3. 真实世界设置。(A) 23自由度Kuka-Allegro与29自由度Flexiv-Sharpa平台,各配备两台RealSense RGB相机(左与中)。(B) FMB销钉与板、盘子与碗架。(C) 真实测试中使用的多样初始状态与光照。

05局限

方法仍依赖仿真中通用重摆放任务对下游接触分布的覆盖程度;若下游出现显著差异的物体、摩擦或接触模式,先验收益可能下降。Geometric Fabric 调解与保守更新有助于稳定与安全,但也可能限制策略追求极限敏捷或非常规运动的能力。

此外,所给摘要对真机失败模式、触觉传感假设、标定与延迟条件,以及大规模预训练与后训练的计算成本着墨有限,完整边界条件仍需结合全文实验与硬件细节进一步评估。

06要点

  1. 01通用物体重摆放预训练可为高自由度多指操作提供可迁移的灵巧行为先验。
  2. 02行为克隆蒸馏、critic 预热与保守 on-policy 更新共同用于稳住后训练、缓解预训练能力退化。
  3. 03关节空间 Geometric Fabric 调解策略与机器人执行,并支撑感知学生的零样本 sim-to-real 蒸馏。

标签

dexterous manipulationsim-to-realRL pretrainingvisuo-tactile

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。