在仿真中进行灵巧手操作的预训练
文章背景与核心概要
尽管大规模预训练显著提升了机器人策略微调的数据效率,但目前的进展主要局限于使用简单平行夹爪的系统。多指灵巧手由于真实世界的远程操作扩展成本高昂,且人类手部视频存在“非具身(off-embodiment)”问题,需要进行有损的姿态估计和重定向,因此一直面临数据匮乏的挑战。
为了解决这一问题,作者提出了“灵巧手仿真预训练(Simulation Pre-training for Dexterity, SPD)”框架,该框架完全依赖于仿真收集的数据。通过使用VR头显,人类操作员在虚拟环境中操纵物体,从而创建了“具身(on-embodiment)”且无需机器人参与的轨迹数据。研究团队仅用一周时间,通过五名操作员收集了75小时的多任务灵巧操作数据,并利用序列建模目标对因果Transformer进行了预训练。在56自由度双臂灵巧手系统上,仅需1-2小时的物理演示进行微调,SPD方法便超越了从零开始训练的传统行为克隆策略,证明了仿真远程操作是实现真实世界灵巧操作预训练的可行路径。
摘要 (Summary)
虽然大规模预训练显著提高了机器人策略微调的数据效率,但进展主要局限于使用简单平行夹爪的系统。多指灵巧手仍然面临数据匮乏的问题,因为现实世界的远程操作扩展成本高昂,而人类手部视频属于非具身数据,需要进行有损的姿态估计和重定向。
While large-scale pre-training has significantly improved data efficiency for robot policy fine-tuning, progress has primarily been restricted to systems utilizing simple parallel-jaw grippers. Multi-fingered dexterous hands remain data-scarce because real-world teleoperation is expensive to scale, whereas human hand videos are off-embodiment and necessitate lossy pose estimation and retargeting.
为了克服这一困难,作者引入了“灵巧手仿真预训练(SPD)”,这是一个完全依赖于仿真收集数据的预训练框架。利用VR头显,人类操作员操纵虚拟物体,创建了具身且无需机器人的轨迹。通过聘请五名操作员,团队在一周内收集了75小时的多任务灵巧操作数据,用于预训练一个采用序列建模目标的因果Transformer。当在56自由度双臂灵巧手设置上仅使用1-2小时的物理演示进行微调时,SPD方法优于从零开始训练的传统行为克隆策略,确立了仿真远程操作作为真实世界灵巧操作预训练的可行途径。
To overcome this, the authors introduce Simulation Pre-training for Dexterity (SPD), a pre-training framework that relies entirely on simulation-collected data. Utilizing VR headsets, human operators manipulate virtual objects, creating on-embodiment, robot-free trajectories. By employing five operators, the team gathered 75 hours of multi-task dexterous manipulation data over a single week to pre-train a causal transformer using a sequence modeling objective. When fine-tuned on just 1–2 hours of physical demonstrations on a 56-DoF bimanual dexterous setup, the SPD approach outperforms traditional behavior cloning policies trained from scratch, establishing simulation teleoperation as a viable pre-training avenue for real-world dexterous manipulation.
文章详情 (Article Details)
- arXiv ID: arXiv:2608.15917 [cs.RO]
- 学科: 机器人学 (
cs.RO), 人工智能 (cs.AI), 计算机视觉与模式识别 (cs.CV) - ACM 分类: I.2.9
- 项目主页: spd.bot
- DOI: 10.48550/arXiv.2608.15917
- arXiv ID: arXiv:2608.15917 [cs.RO]
- Subjects: Robotics (
cs.RO), Artificial Intelligence (cs.AI), Computer Vision and Pattern Recognition (cs.CV)- ACM Classes: I.2.9
- Project Page: spd.bot
- DOI: 10.48550/arXiv.2608.15917
作者 (Authors)
- Sarthak Kamat
- Adam Rashid
- Satvik Sharma
- Aseem Doriwala
- Chelsea Finn
- Phillip Isola
- C. Karen Liu
Authors
- Sarthak Kamat
- Adam Rashid
- Satvik Sharma
- Aseem Doriwala
- Chelsea Finn
- Phillip Isola
- C. Karen Liu
提交历史 (Submission History)
- v1: 2026年8月16日,周日
- v2 (当前版本): 2026年8月27日,周四
Submission History
- v1: Sun, 16 Aug 2026
- v2 (Current): Thu, 27 Aug 2026