文章背景与核心概要
表格数据的自动特征工程(AutoFE)通常面临算子表达能力受限、缺乏记忆的静态大模型提示词以及僵化的演化迁移策略等挑战。为了克服这些障碍,本文作者推出了 TOPOFE 这一全新框架,它将自动特征工程建模为图结构的多岛屿演化程序搜索。
通过将特征变换空间划分为语义一致的族群(每个族群通过大模型引导的变异、交叉以及自适应记忆进行探索),TOPOFE 通过有向拓扑图动态协调全局探索。在 29 个表格数据集上的实验表明,TOPOFE 在分类和回归任务上均持续超越现有的最先进 AutoFE 方法,能够生成具备极高鲁棒性与可迁移性的特征程序。
基于大语言模型的自适应岛屿图演化自动特征工程 (Adaptive Graph-of-Islands Evolution for Automatic Feature Engineering with LLMs)
作者: Sha Li, Naren Ramakrishnan
研究主题: 人工智能 (cs.AI);机器学习 (cs.LG)
arXiv 标识符: [arXiv:2607.23286 [cs.AI]]
DOI: 10.48550/arXiv.2607.23286
提交历史: 2026年7月25日提交;2026年9月2日最后修订 (v2)
📌 摘要 (Summary)
表格数据的自动特征工程(AutoFE)通常面临算子表达能力受限、缺乏记忆的静态 LLM 提示词以及僵化的演化迁移策略等挑战。为了克服这些障碍,作者推出了 TOPOFE,这是一个将 AutoFE 建模为图结构多岛屿演化程序搜索的新颖框架。
通过将变换空间划分为语义一致的族群——每个族群通过 LLM 引导的变异、交叉和一个自适应记忆来进行探索——TOPOFE 通过有向拓扑图动态协调全局探索。在 29 个表格数据集上的实验表明,TOPOFE 在分类和回归任务上均持续优于最先进的 AutoFE 方法,能够产生高度稳健且可迁移的特征程序。
📑 摘要与引言 (Abstract)
表格数据的自动特征工程(AutoFE)需要从巨大的程序空间中发现具有信息量的变换。现有方法存在三个局限性:经典方法依赖于表达能力有限的固定算子库;基于 LLM 的方法从静态提示中生成建议,而没有保留搜索经验;演化方法则使用忽视了特定任务跨族群迁移效用的固定迁移策略。
我们引入了 TOPOFE,这是一个将 AutoFE 表述为图结构多岛屿演化程序搜索的框架。变换空间被划分为语义一致的族群,每个族群由一个岛屿通过 LLM 引导的变异和交叉进行探索。每个岛屿维护一个提示适应记忆(Prompt Adaptation Memory),该记忆累积接受/拒绝反馈,在无需参数更新的情况下引导建议朝向高产区域。
为了协调全局探索,TOPOFE 动态学习一个有向拓扑图,其边权重编码了变换族群之间的迁移效用。跨岛屿迁移通过自适应饱和检测触发,并由 LLM 介导的混合合成来执行,从而能够发现无法从孤立局部搜索中涌现的组合特征程序。
在 29 个表格数据集上的实验表明,TOPOFE 在分类和回归任务上 consistently(持续地)优于大多数最先进的 AutoFE 方法。除了预测性能外,TOPOFE 产生的特征集具有较低的冗余度和更高的表征覆盖率,同时所学习到的拓扑图获得了与下游收益相关的有意义的特定任务迁移结构。所发现的特征程序能够在不同的预测器和 LLM 主干网络之间可靠地迁移,这证明了性能的提升源于 TOPOFE 的结构化搜索和自适应协调,而不是特定于主干网络的生成能力。
🔗 链接与资源 (Links & Resources)
- 全文访问: 查看 PDF | HTML(实验性) | TeX 源码
- 许可证: Creative Commons Zero v1.0 Universal

- 引用与参考: Google Scholar | Semantic Scholar | NASA ADS