跳转至

文章背景与核心概要

在机器人学中,实现高自由度(DoF)机器人的灵巧操作(Dexterity)长期以来一直面临着极大的挑战,尤其是在处理需要长视距(Long-horizon)、原始视触觉感知以及复杂物理交互的任务时。传统的从头开始(From scratch)强化学习往往难以收敛,且在面对不同的下游任务时需要重复学习相同的技能。为此,本文介绍了 ADEPT(Accelerating Dexterity via Pre-Training)这一大规模强化学习框架。

ADEPT 的核心技术路线分为两阶段:首先在一个通用的物体重新放置(Object reposing)任务上预训练一个通用的灵巧操作策略;然后将该预训练策略作为下游任务的先验(Prior),结合行为克隆蒸馏、评论家(Critic)预热以及保守的同策略(On-policy)更新等稳定的后训练方案,实现复杂下游行为的高效学习。此外,为了安全地利用全运动学灵巧性,该框架引入了几何织物(Geometric Fabric)来调节强化学习策略与机器人硬件的关系,并将后训练的教师模型蒸馏为能够直接在真实世界中进行零样本(Zero-shot)迁移的感知学生模型。实验在 23 自由度的 Kuka-Allegro 系统和 29 自由度的 Flexiv-Sharpa 系统上验证了其卓越性能,成功实现了以人类速度运行的复杂长视距灵巧操作。


ADEPT:通过强化学习的预训练与后训练加速机器人灵巧操作 (ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning)

📋 Summary

ADEPT (Accelerating Dexterity via Pre-Training) is a large-scale reinforcement learning (RL) framework designed to achieve sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments. By pretraining a dexterous policy on a generic object reposing task and using it as a prior for downstream post-training, ADEPT enables robots to master complex, long-horizon behaviors from raw visuo-tactile perception at human-level speeds—tasks that are otherwise extremely difficult to discover from scratch.

ADEPT(通过预训练加速灵巧性)是一个大规模强化学习(RL)框架,旨在跨高自由度(DoF)机器人形态实现可在仿真到真实世界(Sim-to-Real)之间迁移的灵巧操作。通过在一个通用的物体重新放置任务上预训练灵巧策略,并将其作为下游后训练的先验,ADEPT 使机器人能够从原始的视触觉感知中,以人类级别的速度掌握复杂、长视距的行为——这些任务如果从头开始探索将极其困难。


📄 Metadata

Field Details
arXiv ID arXiv:2608.19182
Primary Subject Robotics (cs.RO)
Secondary Subjects Artificial Intelligence (cs.AI)
Submission Date August 19, 2026
Authors Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
Project Page adept-dexterity.github.io
字段 详情
arXiv ID arXiv:2608.19182
主要学科 机器人学 (cs.RO)
次要学科 人工智能 (cs.AI)
提交日期 2026年8月19日
作者 Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
项目主页 adept-dexterity.github.io

🔍 Abstract

We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception.

我们推出了“通过预训练加速灵巧性”(ADEPT)框架,这是一个大规模强化学习(RL)框架,用于跨高自由度(DoF)机器人形态学习可在仿真到真实世界之间迁移的灵巧操作,能够直接从原始的视触觉感知中解决长视距任务。

ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task.

ADEPT 在一个通用的物体重新放置任务上预训练灵巧策略,然后以该预训练行为作为先验来进行下游策略的后训练。ADEPT 能够学习多指机器人从头开始极难发现的新行为,并避免了为每个新的下游任务重复学习同一套技能。

The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: 1. 23 DoF Kuka-Allegro with two RGB cameras 2. 29 DoF Flexiv-Sharpa with two RGB cameras and five vision-based tactile sensors

预训练策略可以对下游任务的重新放置阶段进行零样本迁移,但朴素的强化学习微调在迁移过程中会迅速退化这一能力。我们通过一个稳定的后训练方案来解决这个问题,该方案结合了行为克隆蒸馏、评论家预热以及保守的同策略更新。为了安全地发挥全运动学的灵巧性,我们引入了关节空间的几何织物(Geometric Fabric),在 RL 策略与机器人之间起调节作用。我们将后训练的教师模型蒸馏为感知学生模型,并在两种机器人形态上实现了零样本的仿真到真实世界迁移: 1. 23 自由度 Kuka-Allegro(配有两台 RGB 相机) 2. 29 自由度 Flexiv-Sharpa(配有两台 RGB 相机和五个基于视觉的触觉传感器)

The framework successfully solves long-horizon tasks from challenging initial states with dexterity at human-level speed.

该框架成功地从具有挑战性的初始状态出发,以人类级别的灵巧速度解决了长视距任务。


🛠️ Hardware & Embodiments Evaluated

  • Kuka-Allegro Hand System: 23 Degrees of Freedom (DoF) equipped with two RGB cameras.
  • Flexiv-Sharpa System: 29 Degrees of Freedom (DoF) equipped with two RGB cameras and five vision-based tactile sensors.
  • Kuka-Allegro 手部系统: 23 个自由度(DoF),配有两台 RGB 相机。
  • Flexiv-Sharpa 系统: 29 个自由度(DoF),配有两台 RGB 相机和五个基于视觉的触觉传感器。

🔗 Full-Text & Resources