在仿真中预训练视觉灵巧操作
文章背景与核心概要
尽管大规模预训练显著提升了机器人策略微调的数据效率,但其进展主要局限于使用简单平行夹爪的系统。多指灵巧手由于真实世界遥操作的规模化成本高昂,且人类手部视频存在异构体(off-embodiment)问题并需要经过有损的姿态估计与重定向,因此长期面临数据匮乏的困境。
为了克服这一挑战,作者推出了仿真灵巧操作预训练(Simulation Pre-training for Dexterity, SPD),这是一个完全依赖仿真收集数据的预训练框架。利用 VR 头显,人类操作员能够操纵虚拟物体,从而创建同构体(on-embodiment)、无机器人的轨迹。通过 5 名操作员的协作,研究团队在一周内收集了 75 小时的多任务灵巧操作数据,并通过序列建模目标预训练了一个因果 Transformer。在包含 56 自由度双臂灵巧系统的物理演示中,仅需 1-2 小时的微调,SPD 方法便超越了从头开始训练的传统行为克隆策略,确立了仿真遥操作作为真实世界灵巧操作可行预训练途径的地位。
文章详情 (Article Details)
-
arXiv ID: arXiv:2608.15917 [cs.RO]
- arXiv ID: arXiv:2608.15917 [cs.RO]
-
学科分类: 机器人学 (
cs.RO)、人工智能 (cs.AI)、计算机视觉与模式识别 (cs.CV)- Subjects: Robotics (
cs.RO), Artificial Intelligence (cs.AI), Computer Vision and Pattern Recognition (cs.CV)
- Subjects: Robotics (
-
ACM 分类: I.2.9
- ACM Classes: I.2.9
-
项目主页: spd.bot
- Project Page: spd.bot
-
DOI: 10.48550/arXiv.2608.15917
作者 (Authors)
-
Sarthak Kamat
- Sarthak Kamat
-
Adam Rashid
- Adam Rashid
-
Satvik Sharma
- Satvik Sharma
-
Aseem Doriwala
- Aseem Doriwala
-
Chelsea Finn
- Chelsea Finn
-
Phillip Isola
- Phillip Isola
-
C. Karen Liu
- C. Karen Liu
提交历史 (Submission History)
-
v1: 2026年8月16日(星期日)
- v1: Sun, 16 Aug 2026
-
v2(当前版本): 2026年8月27日(星期四)
- v2 (Current): Thu, 27 Aug 2026