跳转至

在仿真中预训练视觉灵巧操作

文章背景与核心概要

尽管大规模预训练显著提升了机器人策略微调的数据效率,但其进展主要局限于使用简单平行夹爪的系统。多指灵巧手由于真实世界遥操作的规模化成本高昂,且人类手部视频存在异构体(off-embodiment)问题并需要经过有损的姿态估计与重定向,因此长期面临数据匮乏的困境。

为了克服这一挑战,作者推出了仿真灵巧操作预训练(Simulation Pre-training for Dexterity, SPD),这是一个完全依赖仿真收集数据的预训练框架。利用 VR 头显,人类操作员能够操纵虚拟物体,从而创建同构体(on-embodiment)、无机器人的轨迹。通过 5 名操作员的协作,研究团队在一周内收集了 75 小时的多任务灵巧操作数据,并通过序列建模目标预训练了一个因果 Transformer。在包含 56 自由度双臂灵巧系统的物理演示中,仅需 1-2 小时的微调,SPD 方法便超越了从头开始训练的传统行为克隆策略,确立了仿真遥操作作为真实世界灵巧操作可行预训练途径的地位。


文章详情 (Article Details)

作者 (Authors)

  • Sarthak Kamat

    • Sarthak Kamat
  • Adam Rashid

    • Adam Rashid
  • Satvik Sharma

    • Satvik Sharma
  • Aseem Doriwala

    • Aseem Doriwala
  • Chelsea Finn

    • Chelsea Finn
  • Phillip Isola

    • Phillip Isola
  • C. Karen Liu

    • C. Karen Liu

提交历史 (Submission History)

  • v1: 2026年8月16日(星期日)

    • v1: Sun, 16 Aug 2026
  • v2(当前版本): 2026年8月27日(星期四)

    • v2 (Current): Thu, 27 Aug 2026