← 最新论文
🤖 machine learning

DataMaster: Towards Autonomous Data Engineering for Machine Learning

本文介绍了 DataMaster,这是一个自主智能体框架,它通过共享数据池和累积记忆,利用树形结构搜索优化数据发现、选择和转换等数据工程任务,从而提升机器学习性能,在不修改底层学习算法的情况下,在 MLE-Bench Lite 和 PostTrainBench 基准测试中取得了显著改进。

原作者: Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烘焙世界上最好的巧克力蛋糕。过去,做出更美味蛋糕的秘诀在于发明新烤箱、革命性的打蛋器,或复杂的新型烘焙算法。但近来,所有的烤箱和打蛋器都已变得大同小异。赢得烘焙比赛的关键并非你使用的工具,而是食材

若想做出更美味的蛋糕,你需要找到最好的可可豆、最新鲜的鸡蛋,以及完美的糖粉配比。然而,寻找并准备这些食材是一项艰巨的工作。通常,烘焙师必须前往市场,猜测哪些豆子品质优良,清洗它们,切碎它们,并寄希望于最佳结果。如果蛋糕失败,他们不得不从头再来,却常常忘记上次究竟哪里出了问题。

DataMaster 是一款专为人工智能(AI)设计的新型“智能助手”,旨在完成上述任务。它并非试图构建更强大的 AI“大脑”(即配方),而是完全专注于寻找并准备最佳数据(即食材),以喂养该大脑。

以下是其工作原理的简明拆解:

1. 问题:“寻找食材”

目前,AI 工程师往往将数据视为既定的固定食材盒。他们试图调整配方(即代码)以使其生效。但论文指出,真正的突破发生在你走出去寻找更好的食材之时。

  • 挑战:互联网上充斥着潜在数据,但杂乱无章。有些数据质量低劣,有些使用非法,还有些不符合配方需求。
  • 旧有方式:人类(或简单机器人)搜索数据,尝试使用,观察 AI 是否提升;若失败,则遗忘过程并尝试其他方案。这就像试图通过尝一口就扔掉整块蛋糕、每次都从头开始的方式来烘焙。

2. 解决方案:"DataMaster 厨房”

DataMaster 是一个自主智能体(即智能机器人厨师),它将数据视为首要改进对象,而非代码。它利用三大核心工具来实现这一目标:

A. DataTree(决策树)

想象一棵树,每个分支代表一种不同的食材准备方式。

  • 红色分支(探索):这些分支深入“市场”(互联网),寻找新的原始食材(外部数据集)。它们尚不“烹饪”,仅收集潜在候选者。
  • 黑色分支(利用):这些分支将收集到的食材实际“烹饪”。它们清洗数据、混合数据,并将其喂给 AI,以观察蛋糕口感是否改善。
  • 为何是树? 若树的某个分支(某种数据混合方式)失败,机器人不会放弃,而是尝试其他分支。它保持所有分支活跃,以便后续比较。

B. 数据池(共享储藏室)

当红色分支发现一种优质新食材(数据集)时,它不会仅使用一次便丢弃,而是将其放入共享储藏室

  • 树中的任何其他分支均可走到储藏室,取用该食材,并尝试以不同方式使用。这意味着机器人绝不会浪费时间重复寻找同一优质食材。

C. 全局记忆(配方笔记本)

这是机器人的长期记忆,它记录:

  • “我们曾尝试将巧克力与盐混合,结果失败。”
  • “周二我们找到了优质的香草豆来源。”
  • “这种特定清洗方法对上一块蛋糕效果显著。”
  • 为何重要:若无此记忆,机器人将重复犯错;有了它,机器人能从每次尝试中学习,即使该尝试发生在树的不同分支上。

3. 如何博弈

机器人拥有有限的时间和资金(即“预算”),无法尝试所有可能的食材组合。

  • 它采用智能策略(如同下棋)来决定下一步探索哪个分支。
  • 若某分支展现潜力(蛋糕口感良好),则投入更多时间于此。
  • 若某分支看似无望,则将其剪除,尝试新方向。
  • 它持续检查“口味测试”(下游训练结果),以验证新食材是否真正提升了 AI 的智力。

4. 结果:蛋糕是否更美味?

作者在两个截然不同的“厨房”中测试了 DataMaster:

  1. "Kaggle"厨房(MLE-Bench Lite):这是一场标准烹饪比赛,食材已提供,但你可添加更多或进行清理。

    • 结果:与仅使用基础食材相比,DataMaster 将“奖牌率”(赢得比赛)提升了32%。它发现,更好地清洗和混合数据是获胜关键。
  2. “白板”厨房(PostTrainBench):这更具挑战性。机器人被赋予一个原始 AI 模型,且任何食材。它必须从零开始寻找数据,并教导模型完成如解数学题或编写代码等任务。

    • 结果:DataMaster 通过寻找并策划合适数据,使一个基础 AI 模型在特定科学测试(GPQA)中的表现超越了人类专家训练的模型。其得分从平均 8% 提升至超过 31%。

核心结论

长期以来,AI 的进步在于构建更大、更聪明的“大脑”(模型)。本文指出:“停止构建更大的大脑;开始为它们提供更优质的食物。”

DataMaster 证明,若拥有一个自主智能体,能够系统地搜索、清洗和混合数据,并铭记过往成功经验,它便能在不修改一行代码的情况下,显著提升固定 AI 模型的智能水平。它将数据工程从杂乱无章的手工杂务,转变为结构化、智能化的搜索过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →