Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
本文介绍了 OpenMLE,一个用于机器学习工程中递归自我改进的开源全栈系统,并展示了 Frontis-MA1,一个利用执行落地训练和长程搜索的 35B 参数规模元进化智能体,该智能体在 MLE 基准测试上显著超越了领先模型,同时展现出对留出任务的强迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个正在构建未来工具的人们本身正被这些工具所构建的世界。这就是“AI为AI”(AI for AI)的领域,这是计算机科学中一个迷人的角落,在这里,人工智能不仅仅是玩游戏或写诗,而是实际在设计、构建和改进其他的AI。这里宏大的梦想是“递归自我改进”(recursive self-improvement),这是一个科幻概念,即一个智能系统变得更擅长制造智能系统,而这些系统又变得更擅长制造下一代系统,从而创造出一个智能爆发的循环。但要实现这一目标,我们需要一个安全的、现实世界的游乐场来测试这些想法。这就是“机器学习工程”(Machine Learning Engineering, MLE)发挥作用的地方。可以将MLE想象成构建现实世界AI模型的繁琐且务实的职业工作:收集数据、训练模型、修复漏洞,并不断微调它们直到它们能够正常运行。它是理论蓝图与一辆真正能跑的汽车之间的区别。如果我们能教会一个AI更好地自主完成这项工程任务,我们或许就能破解那个自我进化的未来之谜。
本文介绍了一个全新的开放式游乐场——OpenMLE,以及一位名为 Frontis-MA1-35B 的明星学生,旨在观察一个AI是否真的能学会成为比教导它的那些人类更优秀的工程师。研究人员不仅构建了一个聪明的机器人,他们还建立了一整座工厂。首先,他们创建了 OpenMLE-Gym,这是一个巨大的数字健身房,拥有近6,000个不同的“锻炼”任务(例如预测股票价格或进行图像分类),AI可以在其中尝试解决问题,并获得关于成功或失败的即时、诚实的反馈。接着,他们教会了他们的AI——Frontis-MA1,四种特定的“肌肉动作”:草拟(编写新代码)、改进(使其更好)、调试(修复错误)以及交叉(将两个好的想法结合在一起)。
奇迹发生在他们让AI练习这些动作的时候。Frontis-MA1并不只是瞎猜,它会在健身房里运行其代码,观察结果,并从错误中学习。研究人员发现,当他们将这种训练与一种被称为 OpenMLE-Evo 的智能搜索策略相结合时,AI不仅是变得稍微好了一点,而是变得显著强大了。在一项名为 MLE-Bench Lite 的高难度测试中,基础模型(训练前的AI)仅在约39%的任务上获得了“奖牌”(顶尖水平的分数)。但在经过训练和搜索循环后,Frontis-MA1-35B跃升至 60.61%。当他们通过一种特殊的“Max”模式将搜索旋钮调得更高时,它达到了 71.21%。
这不仅仅是一个小小的胜利;论文表明,在这些特定的工程任务上,该系统实际上超越了一些世界上最著名、最强大的AI模型(如GPT-5.5和Codex),并且接近了Kimi K3的表现,尽管Frontis-MA1是基于一个规模仅为350亿参数的骨干网络构建的。关键的发现是,AI学会了利用过去的经验来指导未来的搜索。它不再只是随机尝试,而是记住了其问题解决树中的哪些“分支”有效,哪些失败了,以及如何将获胜者结合在一起。作者展示了这种“学习如何学习”的方法如何让AI在找到解决方案后仍能持续改进,将一个简单的修复转化为金牌级的表现。虽然论文并未声称该AI已经实现了完全的、无限的自我改进,但它提供了强有力的证据,证明我们正在从仅仅遵循指令的AI,转向能够真正进化自身工程技能的AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。