跳转至

InferQ:面向量子电路模拟的数据库基准测试

文章背景与核心概要

近年来,关系型数据库管理系统(RDBMS)展现出了通过将量子电路编译为 SQL 工作负载(主要是连接与聚合张量收缩)来执行量子电路模拟的潜力。然而,现有研究通常局限于一小类结构化电路,这限制了系统性的数据库研究,例如查询优化、物理设计和引擎级评估。

为了弥补这一空白,作者提出了 InferQ——一个专为量子电路模拟设计的面向数据库的基准测试。InferQ 能够生成通用且具有组合性的电路,将其转换为可直接在 RDBMS 上运行的 SQL 工作负载,提取全面的特征集用于特征刻画,并提供了一个包含超过 20 万个电路的在线数据集以及一个网页端浏览器。实验结果表明,在超过 50% 的生成电路中,RDBMS 的峰值内存占用表现优于专门的 Qiskit Aer 模拟器,同时机器学习模型能够以高达 97.4% 的准确率预测最佳执行策略。


InferQ 的核心特性

  • 组合式电路生成: 通过组装来自预定义电路模板的子电路,生成多样化且通用的电路。
  • SQL 工作负载生成: 将模拟任务直接翻译为可供 RDBMS 使用的 SQL 工作负载。
  • 工作负载特征刻画: 提取静态、图、SQL 以及动态的电路和查询特征。
  • 丰富的开放数据集: 发布了一个包含 202,975 个电路的公开数据集,并辅以一个用于搜索、筛选和下载电路及特征记录的网页端查看器。
  • Compositional Circuit Generation: Generates diverse and general circuits by assembling subcircuits from predefined circuit templates.
  • SQL Workload Emission: Translates simulation tasks directly into RDBMS-ready SQL workloads.
  • Workload Characterization: Extracts static, graph, SQL, and dynamic circuit and query features.
  • Extensive Open Dataset: Releases a public dataset containing 202,975 circuits, supplemented by a web-based viewer for searching, filtering, and downloading circuit and feature records.

实验见解与结果

  • 引擎对比: 在多个 RDBMS 引擎(包括 PostgreSQL、SQLite、DuckDB 和 Umbra)以及广泛使用的 Qiskit Aer 模拟器之间进行了测试。
  • 内存效率: 在 InferQ 生成的超过 50% 的电路中,RDBMS 引擎的峰值内存占用优于 Qiskit Aer。
  • 以数据为中心的模拟器选择: 利用通过 InferQ 提取的特征,轻量级机器学习模型(线性模型和基于树的模型)能够以高保真度成功预测最佳的 SQL 执行偏好:
  • 运行时间预测准确率: 高达 95.6%
  • 内存预测准确率: 高达 97.4%
  • Engine Comparison: Tested across multiple RDBMS engines—including PostgreSQL, SQLite, DuckDB, and Umbra—alongside the widely used Qiskit Aer simulator.
  • Memory Efficiency: RDBMS engines achieved better peak memory usage than Qiskit Aer on over 50% of the circuits generated by InferQ.
  • Data-Centric Simulator Selection: Utilizing features extracted via InferQ, lightweight machine learning models (linear and tree-based) successfully predict optimal SQL execution preferences with high fidelity:
  • Runtime Prediction Accuracy: Up to 95.6%
  • Memory Prediction Accuracy: Up to 97.4%

全文与资源链接