跳转至

StateM:通过大模型外壳扩放(Harness Scaling),在 Terminal-Bench 2.1 上达成 95.3% 的原始准确率与 15 美元的极致前沿运行成本

文章背景与核心概要

长周期人工智能智能体(Long-horizon AI agents)在执行复杂任务时经常遭遇失败,但这往往是因为执行系统本身的局限性,而非底层模型能力不足——智能体经常迷失于可变状态、无法唤回过去的经验教训、跳过标准流程或过早终止。为了解决这一痛点,本文作者(来自德克萨斯大学奥斯汀分校等机构的学者)推出了 StateM,这是一个专为智能体原生设计的运行时,通过实施外壳扩放(harness scaling)来优化智能体周围的执行系统,而无需修改模型权重。

StateM 的核心机制围绕持久化状态、阶段局部上下文、经检查的转换、可恢复的运行手册以及版本化的程序化实践展开。实验表明,在 Terminal-Bench 2.1 基准测试中,StateM 将 GPT-5.5 xhigh 的准确率从 83.1% 提升至 92.1%,而配合 GPT-5.6 Sol xhigh 时更是创下了 95.3% 的原始准确率,且在所有 89 个任务上均至少成功一次。更引人注目的是其极高的成本效益:API 实际使用成本降至约 15 美元(相比之下 GPT 参考实现高达 574.68 美元),并在 BusinessBench 等其他基准测试中展现出卓越的泛化能力。


目录


状态机 (StateM): 通过外壳扩放 (Harness Scaling) 在 Terminal-Bench 2.1 上实现 95.3% 原始准确率或 15 美元前沿运行成本

作者: Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang
发布时间: 2026年8月15日
主要学科: 人工智能 (cs.AI)
arXiv ID: arXiv:2608.15089
代码库: GitHub - StateM
全文链接: 查看 PDF | HTML 版本


执行摘要

长周期智能体甚至会在其底层模型能够解决组成步骤的情况下失败。它们可能会丢失对可变状态的追踪、无法重新激活早期执行中的教训、跳过已知程序或过早停止。我们押注于外壳扩放(harness scaling),以改进智能体周围的执行系统而不改变其模型权重。我们引入了 StateM,这是一个智能体原生的运行时,它围绕持久状态、阶段局部上下文、受检查的转换、可恢复的手册以及版本化的程序化实践来组织执行,供智能体和用户共同检查。

在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 从 83.1% 提升到 92.1%(参考基线为 83.1%),GPT-5.6 Sol Ultra 为 91.9%。该手册无需修改即可迁移到 GPT-5.6。借助 GPT-5.6 Sol xhigh,StateM 在 445 次试验中达到了 95.3% 的原始准确率,并在所有 89 个任务上至少成功一次。冻结的配置文件将 GPT-5.6 Luna 从 76.7% 提升至 85.4%,超过了 84.9% 的 Sol xhigh 参考基准。

使用相同的运行时、手册结构和黄金规则,少于 38 美元的适应成本将 DeepSeek-V4 Flash 在标准超时下从 82.7% 提高到 88.1%,在 88 个任务的公共核心上提高到 89.1%。仅扩展剩余的对延迟敏感的任务即可匹配报道的 88.8% 的 GPT-5.6 Sol 最大结果。最终得分的 API 使用成本约为 15 美元,而 GPT 参考基准为 574.68 美元;DeepSeek 的总支出为 52.22 美元。

在 BusinessBench 上,在开发集上构建的特定于系列的运行手册产生了 0.55 的宏观和 1.34 的微观测试集增益;两个机制匹配的系列提高了 10.04 点。当任务共享执行结构时,具体规则可以推广,而控制方法则广泛适用。StateM 将选定的事后分析(postmortem)结果转化为持久的、可执行的前提条件和实践,使学习到的控制通过有状态的控制变得显式且可执行。


抽象的 (Abstract)

长周期智能体甚至会在其底层模型能够解决组成步骤的情况下失败。它们可能会丢失对可变状态的追踪、无法重新激活早期执行中的教训、跳过已知程序或过早停止。我们押注于外壳扩放(harness scaling),以改进智能体周围的执行系统而不改变其模型权重。我们引入了 StateM,这是一个智能体原生的运行时,它围绕持久状态、阶段局部上下文、受检查的转换、可恢复的手册以及版本化的程序化实践来组织执行,供智能体和用户共同检查。

在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 提升至 92.1%,而基准参考为 83.1%,GPT-5.6 Sol Ultra 为 91.9\%。该运行手册无缝迁移至 GPT-5.6。通过 GPT-5.6 Sol xhigh,StateM 在 445 次试验中达到了 95.3\% 的原始准确率,并在全部 89 个任务上至少成功一次。冻结的配置文件将 GPT-5.6 Luna 从 76.7 提升至 85.4\%,超越了 84.9\% 的 Sol xhigh 参考值。

使用相同的运行时、运行手册结构和黄金规则,不到 38 美元的适配成本使 DeepSeek-V4 Flash 在标准超时下从 82.7 提升至 88.1\%,并在 88 任务公共核心上达到 89.1\%。仅扩展剩余的延迟敏感任务,即可达到报道的 88.8\% GPT-5.6 Sol 最大结果。最终得分的 API 消耗约为 15 美元,相比之下 GPT 参考值为 574.68 美元;DeepSeek 的总支出为 52.22 美元。

在 BusinessBench 上,基于开发集构建的家族特定运行手册在留出集(held-out)上取得了 0.55 的宏观和 1.34 的微观积分提升;两个机制匹配的家族提升了 10.04 分。当任务共享执行结构时,具体规则可泛化,而控制方法则具有广泛适用性。StateM 将精选的事后分析结果转化为持久、可执行的前提条件与实践,使学习到的控制通过有状态控制变得明确且可强制执行。


StateM 的核心特性

  • 持久且版本化的状态(Durable & Versioned States): 安全管理可变状态,以防止长周期执行中的内存漂移。
  • 阶段局部上下文(Phase-Local Context): 保持智能体的注意力在每个执行阶段的相关信息上。
  • 经检查的转换(Checked Transitions): 在任务阶段之间强制执行严格的验证规则,以防止跳过标准流程。
  • 可恢复的运行手册(Recoverable Runbooks): 允许无缝的错误恢复和智能体内省。
  • 半自进化控制(Semi-Self-Evolving Controls): 将事后分析结果转化为持久的、可执行的前提条件和实践。

license icon