← 최신 논문
🤖 AI

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS 는 예산을 고려한 몬테카를로 트리 탐색 계획, 모듈식 설계-분해-구현 파이프라인, 그리고 비교적 성찰 기억을 통합하여 복잡한 머신러닝 엔지니어링의 병목 현상을 극복하고 MLE-Bench 에서 최첨단 성능을 달성하는 자율 AI 연구를 위한 새로운 프레임워크입니다.

원저자: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고급 요리 대회에서 우승하려고 상상해 보세요. 하지만 매우 엄격한 규칙이 하나 있습니다: 요리에 24 시간만 주어지며, 양파를 썰 때마다 비용이 발생합니다.

이 문제를 해결하려는 대부분의 컴퓨터 프로그램은 한 번에 모든 것을 썰기 시작하는 아마추어 요리사들과 같습니다. 그들은 한 번에 모든 것을 처리하려는 거대하고 지저분한 레시피 (단일 구조 스크립트) 를 작성합니다. 만약 수프를 태우면, 그들은 전체 냄비를 버리고 처음부터 다시 시작합니다. 물을 끓이는 데 얼마나 걸리는지 신경 쓰지 않죠. 그들은 단지 수프가 맛있게 나오기만 바랄 뿐입니다. 실제 AI 연구 세계에서는 이것이 재앙입니다. AI 모델을 훈련시키는 것은 거대한 냄비에 수프를 끓이는 것과 같기 때문입니다. 많은 시간과 전기가 필요하죠.

이 논문은 MARS(Modular Agent with Reflective Search, 반성적 탐색을 갖춘 모듈형 에이전트) 를 소개합니다. 이는 전문가 팀과 스마트한 수첩을 갖춘 셰프와 같습니다.

다음은 MARS 가 작동하는 방식을 세 가지 간단한 부분으로 나눈 설명입니다:

1. "예산 고려형" 탐색 (스마트한 기획자)

"최고의 레시피를 추측하라"는 게임을 한다고 상상해 보세요. 하지만 재료와 시간 예산은 제한되어 있습니다.

  • 옛 방식: 한 가지 레시피가 요리하는 데 10 시간이 걸리더라도 생각나는 모든 레시피를 시도해 봅니다. 맛이 약간만 더 좋다면, 다른 것을 요리할 시간이 부족해지더라도 그것을 선택합니다.
  • MARS 방식: MARS 는 예산 고려형 MCTS라는 전략을 사용합니다. 이는 시계를 바라보는 스마트한 기획자라고 생각하세요. 레시피 A 는 1 시간 걸리고 맛은 "그럭저럭"이며, 레시피 B 는 10 시간 걸리고 맛이 약간 더 좋다면, MARS 는 레시피 A 를 선택합니다. 사소한 개선을 위해 9 시간을 낭비하는 것은 나쁜 거래임을 알기 때문입니다. MARS 는 끊임없이 "이 개선이 추가 시간과 비용을 감당할 만한 가치가 있는가?"라고 묻습니다.

2. 모듈식 구축 (조립 라인)

50 페이지 분량의 거대한 레시피 하나를 작성하는 대신, MARS 는 요리 과정을 작고 분리된 스테이션으로 나눕니다.

  • 옛 방식: 한 명의 요리사가 하나의 혼란스러운 스크립트만 작성합니다. 소스가 잘못되면, 이를 수정하기 위해 50 페이지 분량의 문서 전체를 다시 작성해야 합니다.
  • MARS 방식: MARS 는 "설계 - 분해 - 구현" 파이프라인을 사용합니다. 서로 다른 "에이전트"(전문가 요리사) 를 특정 작업에 할당합니다:
    • 에이전트 A는 채소 (데이터) 를 처리합니다.
    • 에이전트 B는 향신료 (모델 아키텍처) 를 처리합니다.
    • 에이전트 C는 요리 (훈련) 를 처리합니다.
      소스가 너무 짜다면, MARS 는 "향신료 에이전트"의 지시사항만 변경합니다. 채소나 고기는 건드리지 않죠. 이로 인해 코드 수정이 쉬워지고, 테스트가 용이해지며, 전체 시스템이 충돌할 가능성이 크게 줄어듭니다.

3. 비교적 반성 기억 ("아하!" 수첩)

이 부분이 가장 마법과 같습니다. 일반적인 주방에서 요리에 실패하면, 그냥 "그건 안 됐어"라고 말하고 넘어갈 수 있습니다.

  • 옛 방식: AI 에이전트들은 종종 요리가 실패한 이유를 잊어버립니다. 구체적인 원인을 배우지 못했기 때문에 같은 실수를 다시 저지를 수 있습니다.
  • MARS 방식: MARS 는 **"비교적 반성 기억"**을 유지합니다. 새로운 요리가 이전 요리보다 더 좋게 나왔을 때, MARS 는 단순히 "잘했다"라고 말하지 않습니다. 탐정처럼 행동합니다. 이전 레시피와 새로운 레시피 사이의 정확한 차이를 비교합니다.
    • 예시: "아! 새로운 요리가 더 좋은 이유는 소금 한 꼬집을 추가하고 2 분 더 조리했기 때문입니다. 핵심은 시간이 아니라 소금이었습니다."
    • MARS 는 이를 **"교훈"**으로 기록합니다. 나중에 완전히 다른 요리를 시도할 때, "이런 유형의 문제에는 소금이 도움이 된다는 것을 배웠어"라고 말하며 그 교훈을 탐색의 완전히 다른 가지에 적용할 수 있습니다.
    • 논문은 MARS 가 사용한 교훈 중 **63%**가 이러한 "교차 가지 전이"에서 나왔다고 밝혔습니다. 즉, 한 유형의 문제에서 배운 것을 성공적으로 다른 유형에 적용했다는 뜻입니다. 이것이 바로 "아하!" 순간입니다.

결과

연구진들은 MARS 를 MLE-Bench에서 테스트했습니다. 이는 텍스트 분석부터 이미지 인식까지 75 가지 다른 도전 과제가 있는 거대하고 어려운 요리 대회와 같습니다.

  • 대회: 다른 AI 에이전트들 (AIDE 나 AIRA 등) 은 이러한 문제들을 해결하려고 시도했지만, 종종 막히거나 지저분한 코드를 작성하거나, 보상이 없는 비싼 실험에 시간을 낭비했습니다.
  • 승자: MARS 는 다른 오픈소스 시스템보다 더 많은 메달 (금, 은, 동) 을 획득했습니다. 단순히 운이 좋았던 것이 아닙니다. 더 효율적이었습니다. 가치 없는 비싼 실험에 시간을 낭비하지 않고, 실수를 구조화된 방식으로 배우면서 더 빠른 속도로 더 나은 해결책을 찾았습니다.

요약하자면: MARS 는 단순히 "무작위 시도를 하는" AI 연구자가 아닙니다. MARS 는 시간을 신중하게 계획하고, 큰 문제를 작고 관리 가능한 조각으로 나누며, 무엇이 작동했거나 실패했는지 정확한 이유를 상세히 기록하는 수첩을 유지합니다. 이를 통해 경쟁자들보다 훨씬 빠르게 학습하고 개선할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →