解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
文章背景与核心概要
预训练视觉语言模型(VLM)在根据指令和观测生成高层规划方面表现出色,但在陌生环境中难以实现低延迟的动作序列。与此同时,世界模型控制器虽然擅长快速的“观测-动作”控制,却缺乏开放式任务的指导能力。
本文提出了 Instruct-to-Act 系统,旨在弥合上述差距。该系统通过将 VLM 规划器与世界模型控制器相结合,利用合成指令对策略执行轨迹进行重标记,并联合优化行为克隆、奖励最大化和世界建模目标。这使得控制器能够在稀疏的高层文本指令下实现高频自主操作。在七个具身环境(包括三个多智能体场景)中的评估结果表明,这种解耦方法不仅优于纯控制器或直接 VLM 动作生成基线,且在性能上与主流视觉-语言-动作(VLA)及多智能体强化学习方法相当。
论文元数据 (Paper Metadata)
- arXiv ID: 2608.26788
- 主要学科: 人工智能 (
cs.AI) - 次要学科: 计算与语言 (
cs.CL);多智能体系统 (cs.MA);机器人学 (cs.RO) - 作者: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr
- 提交日期: 2026年8月27日
- 会议: 发表于 COLM 2026 会议
摘要 (Abstract)
近期的研究表明,预训练且经过指令微调的视觉语言模型(VLM)在将指令和观测映射为高层规划方面表现良好,但在陌生环境中难以将这些规划转化为可靠的低延迟动作序列。与此同时,世界模型控制器擅长快速的“观测-动作”控制,但缺乏开放式任务的指导。
在这项工作中,我们将这些优势结合到一个单一的系统中,即 Instruct-to-Act。在该系统中,我们训练一个世界模型控制器,使其在 VLM 规划器生成的稀疏、高延迟、高层文本指令的条件下,能够以高频率自主行动。为了训练具有语言指令能力的控制器,我们利用合成指令对控制器策略执行的片段进行重标记,并联合优化行为克隆目标以及现有的奖励最大化和世界建模目标。
我们在七个具身环境中评估了所提出的方法,其中包括三个多智能体环境,在这些环境中,VLM 规划器通过语言进行协调,而训练好的控制器则作为其执行器。在匹配的观测和动作空间下,我们的解耦方法始终优于纯控制器和直接 VLM 动作生成的变体,既保留了快速控制的特性,又允许在无需微调的情况下替换不同的预训练 VLM 规划器,同时在七项任务中的六项上与强大的视觉-语言-动作(VLA)和多智能体强化学习基线保持竞争力。
Recent work shows that pre-trained, instruction-tuned vision-language models (VLMs) perform well at mapping from instructions and observations to high-level plans, but struggle to realize such plans as reliable low-latency action sequences in unfamiliar environments. At the same time, world-model controllers excel at fast observation-to-action control, but lack open-ended task guidance.
In this work, we combine these strengths into a single system, Instruct-to-Act, where we train a world-model controller to act autonomously at high frequency when conditioned on sparse, higher-latency, and high-level text instructions generated by a VLM planner. To train controllers to be language-instructable, we relabel segments of controller policy rollouts with synthetic instructions and jointly optimize a behavior-cloning objective along with existing reward-maximizing and world-modeling objectives.
We evaluate our proposed approach across seven embodied environments, including three multi-agent environments where VLM planners coordinate through language while trained controllers serve as their actuators. Under matched observation and action spaces, our decoupled approach consistently outperforms controller-only and direct VLM action-generation variants, preserves fast control, and lets us swap in different pretrained VLM planners without fine-tuning, while remaining competitive with strong vision-language-action and multi-agent RL baselines on six of seven tasks.
附加资源与链接 (Additional Resources & Links)
- 项目主页: Instruct-to-Act Website
- 全文: View PDF | HTML Version
- 代码与数据: 可通过 Hugging Face 和 CatalyzeX 获取
- 许可协议: Creative Commons Attribution 4.0 International