文章背景与核心概要
自然语言转 SQL(NL-to-SQL)系统在标准学术基准测试中取得了迅猛进展,但在部署到实际的生产企业环境中时却往往表现不佳。企业级生产环境中的数据库架构通常具有图状、半结构化以及深度嵌套的特点,而传统的基准测试未能对这些复杂性进行有效评估。
为了弥补这一空白,本文作者提出了两项核心贡献:首先是 DevRev NL2SQL 基准测试,包含了 900 个经过执行验证的查询,涵盖嵌套类型和链接图结构,并引入了一种与架构无关的推理深度度量指标——语义深度评分(SDS);其次是成本感知单次生成智能体架构,该系统针对深度嵌套的企业级架构进行了优化,集成了目标架构选择、元数据检索以及错误修复机制。在 DevRev NL2SQL 基准测试中,该系统实现了 91.7% 的答案正确率,比次优基准高出 54.6 个百分点;在 Spider 2.0 Snowflake 公开数据集上,它在单次生成运行点上也表现出与领先系统不相上下的竞争力。
面向嵌套企业级架构的成本感知自然语言转SQL智能体架构与全新基准测试 (A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark)
arXiv: 2609.04642 | 学科: 计算机科学 > 人工智能 (cs.AI) | 提交时间: 2026年9月4日
作者: Yoga Sri Varshan Varadharajan, Ajay Yadav, Ritesh Goru, Prateek Chaudhury, Constantine Caramanis, Prateek Jain, Divyateja Pasupuleti, Sunil Kumar Pandey
📌 执行摘要 (Executive Summary)
尽管自然语言转 SQL(NL-to-SQL)系统在标准学术基准测试中取得了快速进展,但当它们被部署到生产企业环境中时,往往会遭遇失败。生产环境的数据库架构通常呈图状、半结构化且深度嵌套——这些复杂性正是传统基准测试无法评估的。
为了解决这一空白,作者引入了两项主要贡献: 1. DevRev NL2SQL 基准测试: 收集了 900 个经过执行验证的查询,具备嵌套类型和链接图结构,并使用一种称为语义深度评分(SDS)的架构无关推理深度指标进行评估。 2. 成本感知单次生成智能体架构: 一个优化系统,具备针对深度嵌套企业架构定制的目标架构选择、元数据检索和错误修复机制。
核心结果
- DevRev NL2SQL 基准测试: 实现了 91.7% 的答案正确率,比次优基准高出 54.6 个百分点。
- Spider 2.0 Snowflake 数据集: 在单次生成的运行点上,展示了与领先系统相媲美的竞争力。
👥 作者 (Authors)
- Yoga Sri Varshan Varadharajan
- Ajay Yadav
- Ritesh Goru
- Prateek Chaudhury
- Constantine Caramanis
- Prateek Jain
- Divyateja Pasupuleti
- Sunil Kumar Pandey
📄 摘要 (Abstract)
自然语言转 SQL 系统在学术基准测试中取得了快速进展,然而生产企业级的数据库架构呈现出图状、半结构化、深度嵌套的结构,这是当前基准测试所无法衡量的。我们做出了两项互补的贡献。首先,我们推出了 DevRev NL2SQL 基准测试:包含 900 个经过执行验证的查询,具有嵌套类型和链接图结构,并配有语义深度评分(SDS),这是一个用于分析推理深度的架构无关评分标准。其次,我们提出了一种成本感知单次生成智能体架构,其架构选择、元数据检索和错误修复组件专为该体系施加的需求而设计。在 DevRev NL2SQL 基准测试中,该系统获得了 91.7% 的答案正确率,比次优基准高出 54.6 个百分点;在 Spider 2.0 Snowflake 公开数据集上,它在单次生成操作点上也具有与领先系统竞争的实力。
Natural-language-to-SQL systems have advanced rapidly on academic benchmarks, yet production enterprise schemas exhibit graph-like, semi-structured, deeply nested structure that current benchmarks do not measure. We make two complementary contributions. First, we introduce the DevRev NL2SQL benchmark: 900 execution-verified queries with nested-type and link-graph structure, accompanied by the Semantic Depth Score (SDS), a schema-agnostic rubric for analytical reasoning depth. Second, we present a cost-aware single-generation agentic architecture whose schema-selection, metadata-retrieval, and error-repair components are designed for the requirements this regime imposes. On the DevRev NL2SQL benchmark the system attains 91.7% answer correctness, a margin of 54.6 percentage points over the next-best baseline; on the Spider 2.0 Snowflake public dataset, it is competitive with leading systems at a single-generation operating point.
🔗 快速链接与资源 (Quick Links & Resources)
- 全文访问:
- 查看 PDF
- HTML(实验性)
- TeX 源码
- 许可证: 知识共享署名 4.0

- 外部引用:
- NASA ADS
- 谷歌学术
- Semantic Scholar