← 최신 논문
💬 NLP

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

이 논문은 머신러닝 엔지니어링에서의 재귀적 자기 개선을 위한 오픈 풀스택 시스템인 OpenMLE를 소개하고, 실행 기반 학습과 장기 탐색을 활용하여 주요 MLE 벤치마크에서 선도적인 모델들을 크게 능가하는 동시에 미학습 작업에 대한 강력한 전이성을 입증한 35B 규모의 메타 진화 에이전트인 Frontis-MA1을 제시한다.

원저자: Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xi
게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

미래를 위한 도구를 만드는 사람들이 그 도구들에 의해 스스로 만들어지고 있는 세상을 상상해 보십시오. 이것은 인공지능이 단순히 게임을 하거나 시를 쓰는 것을 넘어, 실제로 다른 AI를 설계하고, 구축하며, 개선하는 컴퓨터 과학의 매혹적인 영역인 "AI를 위한 AI(AI for AI)"의 영역입니다. 여기서 거대한 꿈은 "재귀적 자기 개선(recursive self-improvement)"입니다. 이는 똑똑한 시스템이 더 똑똑한 시스템을 만드는 데 더 능숙해지고, 그 시스템이 다시 다음 세대를 만드는 데 더욱 능숙해지며, 지능의 폭주하는 루프를 생성하는 공상과학적 개념입니다. 하지만 그곳에 도달하기 위해서는 이러한 아이디어들을 테스트할 수 있는 안전하고 실제적인 놀이터가 필요합니다. 바로 그 지점에서 "머신러닝 엔지니어링(Machine Learning Engineering, MLE)"이 등장합니다. MLE를 실제 세계의 AI 모델을 구축하는 지저분하고 실무적인 작업, 즉 데이터를 수집하고, 훈련시키고, 버그를 수정하고, 제대로 작동할 때까지 미세하게 조정하는 일이라고 생각하십시오. 이것은 이론적인 설계도와 실제로 움직이는 자동차의 차이와 같습니다. 만약 우리가 AI에게 이 엔지니어링 작업을 스스로 더 잘 수행하도록 가르칠 수 있다면, 우리는 그 자기 개선하는 미래의 암호를 풀 수 있을지도 모릅니다.

이 논문은 AI가 진정으로 자신을 가르친 인간보다 더 나은 엔지니어가 될 수 있는지 확인하기 위해, 새로운 개방형 놀이터인 OpenMLE와 스타 학생인 Frontis-MA1-35B를 소개합니다. 연구진은 단순히 하나의 똑똑한 로봇을 만든 것이 아니라, 전체 공장을 구축했습니다. 먼저, 그들은 AI가 문제를 해결하고 성공 또는 실패 여부에 대해 즉각적이고 정직한 피드백을 받을 수 있는 약 6,000개의 다양한 "운동" 과제(주가 예측이나 이미지 분류와 같은)가 포함된 거대한 디지털 체육관인 OpenMLE-Gym을 만들었습니다. 그런 다음, 그들은 자신들의 AI인 Frontis-MA1에게 네 가지 특정한 "근육 동작"을 가르쳤습니다: Draft(새로운 코드 작성), Improve(개선하기), Debug(오류 수정), 그리고 Crossover(두 가지 좋은 아이디어를 혼합하기)입니다.

마법은 그들이 AI가 이 동작들을 연습하게 할 때 일어납니다. 단순히 추측하는 대신, Frontis-MA1은 체육관에서 코드를 실행하고, 결과를 확인하며, 자신의 실수로부터 배웁니다. 연구진은 이 훈련을 OpenMLE-Evo라는 스마트한 탐색 전략과 결합했을 때, AI가 단순히 약간 더 나아지는 수준을 넘어 극적으로 향상되었다는 것을 발견했습니다. MLE-Bench Lite라는 까다로운 테스트에서, 베이스 모델(훈련 전의 AI)은 과제의 약 39%에서만 "메달"(최상위 점수)을 획득했습니다. 그러나 훈련과 탐색 루프를 거친 후, Frontis-MA1-35B는 **60.61%**로 뛰어올랐습니다. 그들이 특별한 "Max" 모드로 탐색 다이얼을 더 높게 돌렸을 때, 이 모델은 **71.21%**에 도달했습니다.

이것은 단순한 작은 승리가 아닙니다. 이 논문은 이 시스템이 이러한 특정 엔지니어링 작업에서 세계에서 가장 유명하고 강력한 AI 모델들(GPT-5.5 및 Codex와 같은) 중 일부를 실제로 능가했다는 것을 시사하며, 심지어 Frontis-MA1이 350억 개의 파라미터를 가진 더 작은 백본을 기반으로 구축되었음에도 불구하고 Kimi K3의 성능에 근접했습니다. 핵심적인 발견은 AI가 자신의 과거 경험을 사용하여 미래의 탐색을 안내하는 법을 배웠다는 것입니다. AI는 단순히 무작위로 시도한 것이 아니라, 어떤 "가지(branch)"가 작동했는지, 어떤 것이 실패했는지, 그리고 승자들을 어떻게 혼합해야 하는지를 기억했습니다. 저자들은 이러한 "배우는 법을 배우는(learning to learn)" 접근 방식이 AI가 작동하는 해결책을 찾은 후에도 계속해서 개선할 수 있게 하여, 단순한 수정을 금메달급 성과로 바꾼다는 것을 보여줍니다. 비록 이 논문이 AI가 완전하고 무한한 자기 개선을 달랐다고 주장하는 데까지는 이르지 않았지만, 우리는 AI가 단순히 지시를 따르는 단계에서 진정으로 자신의 엔지니어링 기술을 진화시킬 수 있는 단계로 이동하고 있다는 강력한 증거를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →