← 最新论文
🤖 machine learning

CoFEH: LLM-driven Feature Engineering Empowered by Collaborative Bayesian Hyperparameter Optimization

本文介绍了 CoFEH,这是一个协同框架,通过相互调节机制和动态步骤选择,将大语言模型驱动的特征工程与贝叶斯超参数优化协同交织,以克服传统 AutoML 中搜索空间僵化和工作流程贪婪的局限性。

原作者: Beicheng Xu, Keyao Ding, Wei Liu, Yupeng Lu, Bin Cui

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Beicheng Xu, Keyao Ding, Wei Liu, Yupeng Lu, Bin Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是CoFEH论文的通俗化解释,辅以富有创意的类比。

核心难题:打造更强大的机器学习机器

想象你正在试图打造一辆终极赛车。你有两项主要工作:

  1. 准备燃料(特征工程):你需要提炼原始燃料(数据),以便引擎能高效燃烧。这包括过滤杂质、混合特殊添加剂,或改变燃料的化学结构。
  2. 调校引擎(超参数优化):你需要调整引擎的设置(如火花塞点火时机、燃油喷射速率),以从燃料中榨取最大速度。

旧方法:
传统上,工程师们将这些工作分开并按僵硬的顺序进行。

  • 首先,他们使用一本固定的食谱书(一组有限的预定义化学反应)来混合燃料。他们无法发明新的添加剂,只能混合书中已有的内容。
  • 一旦燃料“完成”,他们就会锁定食谱,开始调校引擎。
  • 缺陷:这就像用低标号汽油调校法拉利引擎。如果燃料糟糕,无论引擎如何调校,车都跑不快。反之,如果你有绝佳的燃料但引擎调校不当,你依然会输掉比赛。旧方法没有意识到,最佳燃料取决于最佳引擎设置,反之亦然。

新方案:CoFEH

这篇论文的作者创建了CoFEH(协同特征工程与超参数优化)。将 CoFEH 想象成一个超级聪明的双人维修团队,在实时协作工作。

1. “创意厨师”(大语言模型)

CoFEH 不使用僵硬的食谱书,而是利用大语言模型(LLM)作为“创意厨师”。

  • 它做什么:这位厨师不仅仅是从列表中混合食材。它会阅读数据,理解问题的“风味”,并即时发明的食材和烹饪技巧。
  • “思维树”类比:想象这位厨师正在探索一片巨大、无限的食谱森林。它不是只走一条路,而是采用“思维树”策略。它会分叉探索,尝试几条路径,发现某条路通向死胡同时便回退,然后尝试完全不同的方向。这使得它能够找到那些僵化系统永远想不到的、真正独特且强大的数据转换方法。

2. “精密技师”(贝叶斯优化)

当厨师在发明新燃料时,一位“精密技师”(使用一种称为贝叶斯优化的方法)正在调校引擎。

  • 旧问题:通常,厨师制作好燃料,交给技师,说:“来,调校这个。”技师尝试调校,但如果燃料很奇怪,技师可能会放弃或调校不当。
  • CoFEH 的改进:厨师和技师现在持续对话
    • 技师告诉厨师:“嘿,你做的这种新燃料添加剂在这个特定引擎设置下效果很好,但在另一个设置下却失败了。”
    • 厨师告诉技师:“好的,我会调整食谱,以更好地匹配你的引擎设置。”
    • 他们在一个循环中工作,同时优化燃料和引擎设置。这被称为相互条件化(Mutual Conditioning)

3. “团队队长”(动态选择器)

团队只有有限的时间(预算)来调试赛车。此刻他们应该专注于什么?

  • 旧方法:无论情况如何,他们都会花 50% 的时间在燃料上,50% 的时间在引擎上。
  • CoFEH 的改进:一位“团队队长”观察进度。
    • 如果赛车因为燃料糟糕而挣扎,队长会大喊:“厨师,继续烹饪!暂时忽略引擎!”
    • 如果燃料完美但引擎在喘息,队长会喊道:“技师,精细调校引擎!厨师可以休息一下。”
    • 这确保他们将时间恰好花在针对那场特定比赛最重要的地方。

为什么这很重要?

该论文在28 个不同的数据集上测试了这个系统(可以将这些想象为 28 种规则各异的赛道)。

  • 结果:CoFEH 击败了所有其他方法,包括旧的僵化系统和使用大语言模型的其他 AI 系统。
  • 秘密武器
    1. 自由度:它不被困在固定的操作列表中。它可以发明新的操作。
    2. 协作:它不是分开处理燃料和引擎工作。它是一起处理,使它们相互促进。
    3. 适应性:它知道何时专注于数据,何时专注于模型,从而节省时间和能量。

总结

想象你正在试图解决一个拼图。

  • 旧 AI:试图用锤子(僵化的规则)强行将拼图块塞进盒子里。
  • 其他新 AI:使用智能机器人寻找拼图块,但机器人一次只寻找一块,忽略了它们如何相互契合。
  • CoFEH:使用专家团队。一位专家(大语言模型)是拼图大师,必要时可以发明新的拼图块。另一位专家(优化器)确切知道如何排列它们。他们并肩站立,不断说道:“如果我们把这块移到那里,它会与那块更好地契合”,直到拼图被完美解决。

该论文声称,通过让这两位专家实时协作并共享信息,他们能够比任何先前的方法更好、更快地解决复杂的数据问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →