← 最新论文
💬 NLP

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

本文介绍了 OpenMLE,一个用于机器学习工程中递归自我改进的开源全栈系统,并展示了 Frontis-MA1,一个利用执行落地训练和长程搜索的 35B 参数规模元进化智能体,该智能体在 MLE 基准测试上显著超越了领先模型,同时展现出对留出任务的强迁移能力。

原作者: Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xi
发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个正在构建未来工具的人们本身正被这些工具所构建的世界。这就是“AI为AI”(AI for AI)的领域,这是计算机科学中一个迷人的角落,在这里,人工智能不仅仅是玩游戏或写诗,而是实际在设计、构建和改进其他的AI。这里宏大的梦想是“递归自我改进”(recursive self-improvement),这是一个科幻概念,即一个智能系统变得更擅长制造智能系统,而这些系统又变得更擅长制造下一代系统,从而创造出一个智能爆发的循环。但要实现这一目标,我们需要一个安全的、现实世界的游乐场来测试这些想法。这就是“机器学习工程”(Machine Learning Engineering, MLE)发挥作用的地方。可以将MLE想象成构建现实世界AI模型的繁琐且务实的职业工作:收集数据、训练模型、修复漏洞,并不断微调它们直到它们能够正常运行。它是理论蓝图与一辆真正能跑的汽车之间的区别。如果我们能教会一个AI更好地自主完成这项工程任务,我们或许就能破解那个自我进化的未来之谜。

本文介绍了一个全新的开放式游乐场——OpenMLE,以及一位名为 Frontis-MA1-35B 的明星学生,旨在观察一个AI是否真的能学会成为比教导它的那些人类更优秀的工程师。研究人员不仅构建了一个聪明的机器人,他们还建立了一整座工厂。首先,他们创建了 OpenMLE-Gym,这是一个巨大的数字健身房,拥有近6,000个不同的“锻炼”任务(例如预测股票价格或进行图像分类),AI可以在其中尝试解决问题,并获得关于成功或失败的即时、诚实的反馈。接着,他们教会了他们的AI——Frontis-MA1,四种特定的“肌肉动作”:草拟(编写新代码)、改进(使其更好)、调试(修复错误)以及交叉(将两个好的想法结合在一起)。

奇迹发生在他们让AI练习这些动作的时候。Frontis-MA1并不只是瞎猜,它会在健身房里运行其代码,观察结果,并从错误中学习。研究人员发现,当他们将这种训练与一种被称为 OpenMLE-Evo 的智能搜索策略相结合时,AI不仅是变得稍微好了一点,而是变得显著强大了。在一项名为 MLE-Bench Lite 的高难度测试中,基础模型(训练前的AI)仅在约39%的任务上获得了“奖牌”(顶尖水平的分数)。但在经过训练和搜索循环后,Frontis-MA1-35B跃升至 60.61%。当他们通过一种特殊的“Max”模式将搜索旋钮调得更高时,它达到了 71.21%

这不仅仅是一个小小的胜利;论文表明,在这些特定的工程任务上,该系统实际上超越了一些世界上最著名、最强大的AI模型(如GPT-5.5和Codex),并且接近了Kimi K3的表现,尽管Frontis-MA1是基于一个规模仅为350亿参数的骨干网络构建的。关键的发现是,AI学会了利用过去的经验来指导未来的搜索。它不再只是随机尝试,而是记住了其问题解决树中的哪些“分支”有效,哪些失败了,以及如何将获胜者结合在一起。作者展示了这种“学习如何学习”的方法如何让AI在找到解决方案后仍能持续改进,将一个简单的修复转化为金牌级的表现。虽然论文并未声称该AI已经实现了完全的、无限的自我改进,但它提供了强有力的证据,证明我们正在从仅仅遵循指令的AI,转向能够真正进化自身工程技能的AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →