文章背景与核心概要
在机器人学中,实现高自由度(DoF)机器人的灵巧操作(Dexterity)长期以来一直面临着极大的挑战,尤其是在处理需要长视距(Long-horizon)、原始视触觉感知以及复杂物理交互的任务时。传统的从头开始(From scratch)强化学习往往难以收敛,且在面对不同的下游任务时需要重复学习相同的技能。为此,本文介绍了 ADEPT(Accelerating Dexterity via Pre-Training)这一大规模强化学习框架。
ADEPT 的核心技术路线分为两阶段:首先在一个通用的物体重新放置(Object reposing)任务上预训练一个通用的灵巧操作策略;然后将该预训练策略作为下游任务的先验(Prior),结合行为克隆蒸馏、评论家(Critic)预热以及保守的同策略(On-policy)更新等稳定的后训练方案,实现复杂下游行为的高效学习。此外,为了安全地利用全运动学灵巧性,该框架引入了几何织物(Geometric Fabric)来调节强化学习策略与机器人硬件的关系,并将后训练的教师模型蒸馏为能够直接在真实世界中进行零样本(Zero-shot)迁移的感知学生模型。实验在 23 自由度的 Kuka-Allegro 系统和 29 自由度的 Flexiv-Sharpa 系统上验证了其卓越性能,成功实现了以人类速度运行的复杂长视距灵巧操作。
ADEPT:通过强化学习的预训练与后训练加速机器人灵巧操作 (ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning)
📋 Summary
ADEPT (Accelerating Dexterity via Pre-Training) is a large-scale reinforcement learning (RL) framework designed to achieve sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments. By pretraining a dexterous policy on a generic object reposing task and using it as a prior for downstream post-training, ADEPT enables robots to master complex, long-horizon behaviors from raw visuo-tactile perception at human-level speeds—tasks that are otherwise extremely difficult to discover from scratch.
ADEPT(通过预训练加速灵巧性)是一个大规模强化学习(RL)框架,旨在跨高自由度(DoF)机器人形态实现可在仿真到真实世界(Sim-to-Real)之间迁移的灵巧操作。通过在一个通用的物体重新放置任务上预训练灵巧策略,并将其作为下游后训练的先验,ADEPT 使机器人能够从原始的视触觉感知中,以人类级别的速度掌握复杂、长视距的行为——这些任务如果从头开始探索将极其困难。
📄 Metadata
Field Details arXiv ID arXiv:2608.19182Primary Subject Robotics ( cs.RO)Secondary Subjects Artificial Intelligence ( cs.AI)Submission Date August 19, 2026 Authors Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa Project Page adept-dexterity.github.io
| 字段 | 详情 |
|---|---|
| arXiv ID | arXiv:2608.19182 |
| 主要学科 | 机器人学 (cs.RO) |
| 次要学科 | 人工智能 (cs.AI) |
| 提交日期 | 2026年8月19日 |
| 作者 | Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa |
| 项目主页 | adept-dexterity.github.io |
🔍 Abstract
We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception.
我们推出了“通过预训练加速灵巧性”(ADEPT)框架,这是一个大规模强化学习(RL)框架,用于跨高自由度(DoF)机器人形态学习可在仿真到真实世界之间迁移的灵巧操作,能够直接从原始的视触觉感知中解决长视距任务。
ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task.
ADEPT 在一个通用的物体重新放置任务上预训练灵巧策略,然后以该预训练行为作为先验来进行下游策略的后训练。ADEPT 能够学习多指机器人从头开始极难发现的新行为,并避免了为每个新的下游任务重复学习同一套技能。
The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: 1. 23 DoF Kuka-Allegro with two RGB cameras 2. 29 DoF Flexiv-Sharpa with two RGB cameras and five vision-based tactile sensors
预训练策略可以对下游任务的重新放置阶段进行零样本迁移,但朴素的强化学习微调在迁移过程中会迅速退化这一能力。我们通过一个稳定的后训练方案来解决这个问题,该方案结合了行为克隆蒸馏、评论家预热以及保守的同策略更新。为了安全地发挥全运动学的灵巧性,我们引入了关节空间的几何织物(Geometric Fabric),在 RL 策略与机器人之间起调节作用。我们将后训练的教师模型蒸馏为感知学生模型,并在两种机器人形态上实现了零样本的仿真到真实世界迁移: 1. 23 自由度 Kuka-Allegro(配有两台 RGB 相机) 2. 29 自由度 Flexiv-Sharpa(配有两台 RGB 相机和五个基于视觉的触觉传感器)
The framework successfully solves long-horizon tasks from challenging initial states with dexterity at human-level speed.
该框架成功地从具有挑战性的初始状态出发,以人类级别的灵巧速度解决了长视距任务。
🛠️ Hardware & Embodiments Evaluated
- Kuka-Allegro Hand System: 23 Degrees of Freedom (DoF) equipped with two RGB cameras.
- Flexiv-Sharpa System: 29 Degrees of Freedom (DoF) equipped with two RGB cameras and five vision-based tactile sensors.
- Kuka-Allegro 手部系统: 23 个自由度(DoF),配有两台 RGB 相机。
- Flexiv-Sharpa 系统: 29 个自由度(DoF),配有两台 RGB 相机和五个基于视觉的触觉传感器。
🔗 Full-Text & Resources
- PDF Version: View PDF
- HTML Version: arXiv HTML
- TeX Source: Download Source
- License: Creative Commons Attribution 4.0
- PDF 版本: 查看 PDF
- HTML 版本: arXiv HTML
- TeX 源码: 下载源码
- 开源许可: 知识共享署名 4.0
