新篇强化学习2026
ADEPT:预训练与后训练加速高自由度灵巧操作
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
Jayjun Lee, Jessica Yin, Asif Rana et al.·arXiv 2608.191820 引用44 阅读