探索

按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。

新篇强化学习2026

ADEPT:预训练与后训练加速高自由度灵巧操作

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。

Jayjun Lee, Jessica Yin, Asif Rana et al.·arXiv 2608.191820 引用44 阅读