文章背景与核心概要
在大语言模型(LLM)的底层代码和内核(Kernel)优化领域,大模型正逐渐成为强大的智能体工具。然而,完全依赖孤立的内核基准测试会导致一个严重的“基准到部署差距”:在独立测试框架中表现出高性能和正确性的候选内核,一旦集成到真实的推理工作负载中,往往会出现性能倒退、安全问题或行为偏离。
为了解决这一痛点,作者提出了 LLM4LLM——一个具备部署感知能力的闭环优化框架。LLM4LLM 从目标推理脚本出发,提取阶段感知的优化任务,利用经验引导的偶联智能体(episodic agent)在优化空间中进行导航,并通过严格的模型内验证安全地集成补丁。在 A100 和 H100 GPU 上对十个 LLM 推理工作负载进行的评估表明,LLM4LLM 显著提升了所有测试模型的端到端延迟,在 A100 和 H100 上分别取得了 3.91 倍和 6.98 倍的几何平均加速比。
LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization
Authors: Hui Zeng, Pengfei Yang, Yanxin Chen, Fusong Ju, Xinran Wei
Published: August 22, 2026 (Accepted by EMNLP 2026 Main Conference)
Subjects: Artificial Intelligence (cs.AI)
arXiv ID: 2608.21836 | DOI: 10.48550/arXiv.2608.21836
Summary
大语言模型(LLMs)已成为用于底层代码和内核优化的强大智能体。然而,严格依赖孤立的内核基准测试会导致基准到部署差距(benchmark-to-deployment gap):在独立测试工具中显得快速且正确的候选内核,在集成到真实世界的推理工作负载中时,可能会表现出性能退化、安全问题或行为分化。
Large language models (LLMs) have emerged as powerful agents for low-level code and kernel optimization. However, relying strictly on isolated kernel benchmarks creates a benchmark-to-deployment gap: candidate kernels that appear fast and correct in standalone test harnesses can exhibit performance regressions, safety issues, or divergent behavior when integrated into real-world inference workloads.
为了解决这个问题,作者推出了 LLM4LLM,这是一个具备部署感知能力的闭环优化框架。LLM4LLM 从目标推理脚本开始,提取阶段感知(phase-aware)的优化任务,利用经验引导的偶联智能体导航优化空间,并通过严格的模型内验证安全地集成补丁。
To solve this, the authors introduce LLM4LLM, a deployment-aware, closed-loop optimization framework. LLM4LLM starts from a target inference script, extracts phase-aware optimization tasks, navigates the optimization space using an experience-guided episodic agent, and safely integrates patches via rigorous in-model validation.
核心结果
- 端到端延迟: 在 A100 和 H100 GPU 上的十个 LLM 推理工作负载中进行评估,LLM4LLM 改善了所测试的每个模型的端到端延迟。
- 加速比: 在 A100 GPU 上实现了 3.91× 的几何平均加速,在 H100 GPU 上实现了 6.98× 的几何平均加速。
- 内核级性能: 在 KernelBench Level 2 上实现了高达 2.745× 的几何平均加速。
Key Results
- End-to-End Latency: Evaluated across ten LLM inference workloads on A100 and H100 GPUs, LLM4LLM improves end-to-end latency for every model tested.
- Speedups: Achieves geometric-mean speedups of 3.91× on A100 GPUs and 6.98× on H100 GPUs.
- Kernel-Level Performance: Attains up to a 2.745× geometric-mean speedup on KernelBench Level 2.
Abstract
大语言模型已日益成为低级代码和内核优化中能力出众的智能体,但孤立的内核基准测试只能作为语言模型推理中真正关心的部署行为的一种代理指标。我们识别出了一个基准到部署的差距:在独立测试工具中表现正确且快速的候选内核,在集成到真实推理工作负载后,可能会展现出不同的性能、安全性或阶段行为。我们推出了 LLM4LLM,这是一个部署感知的闭环优化框架,它从目标推理脚本出发,提取阶段感知的优化任务,利用经验引导的偶联智能体进行搜索,并通过模型内验证接受补丁。在 A100 和 H100 GPU 上的十个语言模型推理工作负载中,LLM4LLM 改善了每个被评估模型的端到端延迟,在 A100/H100 上实现了 3.91×/6.98× 的几何平均加速比;作为支撑的内核级证据,它在 KernelBench Level 2 上也获得了高达 2.745× 的几何平均加速比。
Large language models have become increasingly capable agents for low-level code and kernel optimization, but isolated kernel benchmarks provide only a proxy for the deployment behavior that matters in language-model inference. We identify a benchmark-to-deployment gap: candidate kernels that appear correct and fast in standalone harnesses can exhibit different performance, safety, or phase behavior after integration into a real inference workload. We introduce LLM4LLM, a deployment-aware closed-loop optimization framework that starts from a target inference script, extracts phase-aware optimization tasks, searches with an experience-guided episodic agent, and accepts patches through in-model validation. Across ten language-model inference workloads on A100 and H100 GPUs, LLM4LLM improves end-to-end latency for every evaluated model, achieving 3.91×/6.98× geometric-mean speedups on A100/H100; as supporting kernel-level evidence, it also attains up to 2.745× GeoMean speedup on KernelBench Level 2.
Full-Text & Resources
- PDF 版本: 查看 PDF
- HTML 版本: 实验性 HTML
- TeX 源码: 下载源码
- 引用: Google 学术 | Semantic Scholar
- PDF Version: View PDF
- HTML Version: Experimental HTML
- TeX Source: Download Source
- Citations: Google Scholar | Semantic Scholar