← 최신 논문
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

이 논문은 대규모 추론 모델(Large Reasoning Models)의 토큰 비효율성과 지식 한계를 극복하기 위해 두 가지 인지 체계(빠른 직관과 숙고하는 추론)를 공동 진화시키는 새로운 다중 에이전트 강화 학습 프레임워크인 MARS를 소개하며, 이를 통해 지도 미세 조정 없이도 지식 집약적 작업에서 최첨단 성능을 달성한다.

원저자: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

MARS 논문 설명: 일상적인 언어와 창의적인 비유를 통한 해설

거대한 문제: "과하게 생각하는 자"와 "시대에 뒤떨어진" 도서관

당신에게 아주 똑똑하고 훌륭한 조수(AI)가 있다고 상상해 보세요. 이 조수는 어려운 퍼즐을 푸는 데 매우 능숙합니다. 하지만 이 조수에게는 두 가지 큰 결함이 있습니다.

  1. 과하게 생각하는 자 (The Over-Thinker): 당신이 간단한 뉴스 기사를 읽거나 웹페이지를 요약해 달라고 요청할 때, 이 조수는 가끔 "깊은 생각" 모드에 빠져버립니다. 굳이 깊은 분석이 필요 없는 부분까지 모든 단어를 하나하나 분석하며 시간과 에너지를 낭비하곤 합니다. 마치 호두를 까는 데 대형 망치를 사용하는 것과 같습니다.
  2. 시대에 뒤떨어진 도서관 (The Out-of-Date Library): 이 조수의 지식은 학습이 끝난 날에 멈춰 있습니다. 만약 어제 일어난 일에 대해 묻는다면, 이 조수는 아무것도 모릅니다. 또한, 엄청난 양의 새로운 정보가 쏟も지는 상황에서 스스로 정보를 찾아내려 하면 혼란에 빠지기 쉽습니다.

해결책: MARS (두 개의 뇌 팀)

연구진은 MARS라고 불리는 새로운 시스템을 만들었습니다. 하나의 뇌가 모든 것을 다 하려고 하는 대신, 인간의 뇌가 작동하는 방식에서 영감을 얻어 동일한 AI 내부에서 작동하는 두 개의 뚜렷한 "성격"을 가진 팀을 구축했습니다.

  • 시스템 1 (빠른 정찰병 - The Fast Scout): 이것은 "직관적인" 뇌입니다. 빠르고 효율적이며 스캐닝에 능숙합니다. 이 정찰병의 임무는 방대한 양의 새로운 정보(예: 10개의 서로 다른 웹 페이지나 연구 논문)를 살펴보고 가장 중요한 사실만을 빠르게 뽑아내는 것입니다. 이는 앞서 달려가 유용한 물자만 챙기고 쓰레기는 남겨두고 오는 정찰병과 같습니다.
  • 시스템 2 (깊은 사색가 - The Deep Thinker): 이것은 "신중한" 뇌입니다. 느리고 신중하며 복잡한 논리 퍼즐을 푸는 데 탁월합니다. 시스템 1이 정제해 준 깨끗하고 핵심적인 사실들을 가져와 실제 문제를 해결하는 데 사용합니다.

마법 같은 기술:
이전의 시스템들에서는 "정찰병"과 "사색가"가 따로 학습되었습니다. 정찰병은 사색가가 무엇을 필요로 하는지 몰랐기 때문에, 사색가가 전혀 신경 쓰지 않는 내용을 요약하거나 사색가가 간절히 필요로 하는 세부 사항을 놓치기도 했습니다.

MARS에서 그들은 **공진화(Co-evolve)**합니다. 그들은 함께 학습합니다. 정찰병은 사색가가 퍼즐을 푸는 데 어떤 종류의 정보가 도움이 되는지 정확히 배우고, 사색가는 정찰병에게 무엇을 요청해야 할지 배웁니다. 그들은 동일한 "점수(보상)"를 공유하므로, 두 명의 낯선 사람이 아니라 완벽한 팀으로서 작동합니다.

학습 방법: "그룹 게임"

이 두 시스템이 인간의 도움 없이(이것을 "Zero RL"이라고 하며, 미리 작성된 예시 없이 맨바닥에서 시작하는 것을 의미합니다) 협력하도록 가르치기 위해, 연구진은 **GRPO(Group Relative Policy Optimization)**를 기반으로 한 영리한 훈련 게임을 사용했습니다.

스포츠 팀이 챔피언십을 위해 연습하는 과정을 생각해 보세요:

  1. 팀 회의 (Bin-Packing): 팀이 정보를 수집하러 나갈 때, 10개의 서로 다른 웹 페이지를 발견할 수도 있습니다. 이를 한꺼번에 읽기에는 너무 많습니다. 시스템은 "빈 패킹(Bin-Packing)" 전략(식료품을 봉투에 담는 것과 유사)을 사용하여, 이 제각각인 크기의 페이지들을 깔끔하고 관리하기 쉬운 덩어리로 조직하여 정찰병이 과부하 없이 동시에 읽을 수 있도록 합니다.
  2. 전광판 (공유 보상): 팀은 문제를 해결하기 위해 현장에 나갑니다. 만약 정답을 맞히면 정찰병과 사색가 모두 점수를 얻습니다. 틀리면 둘 다 점수를 얻지 못합니다. 이는 그들이 협력하도록 강제합니다.
  3. 공정한 경기 (Decoupled Gradients): 여기가 까다로운 부분입니다. 점수는 공유하지만, 연구진은 정찰병은 "요약을 잘하는 것"에 대해, 사색가는 "추론을 잘하는 것"에 대해 각각 공로를 인정받도록 만들었습니다. 이는 계주 경기와 같습니다. 팀이 승리하면 두 주자 모두 메달을 받지만, 코치는 누가 첫 번째 구간을 뛰었고 누가 두 번째 구간을 뛰었는지 정확히 알고 있습니다. 이를 통해 정찰병은 단순히 사색가를 돕는 것이 아니라, 더 나은 정찰병이 되는 법을 배울 수 있습니다.
  4. 팀의 균형 (Balanced Sampling): 때때로 정찰병은 5개의 페이지를 읽어야 하고, 때로는 1개만 읽어야 합니다. 이는 훈련 데이터의 불균형을 초래할 수 있습니다. 시스템은 정찰병과 사색가가 동일한 연습 시간을 가질 수 있도록 특별한 샘플링 방법을 사용하여, 어느 한쪽이 학습 과정을 독점하지 않도록 합니다.

결과: 작은 팀, 큰 승리

연구진은 과학, 수학, 역사 등 고급 주제를 다루는 매우 어려운 시험인 **HLE (Humanity's Last Exam)**를 통해 MARS를 테스트했습니다.

  • 언더독 (The Underdog): MARS는 상대적으로 작은 모델(80억 개의 파라미터)을 사용했습니다.
  • 거인들 (The Giants): MARS는 훨씬 더 큰 모델(320억 또는 720억 파라미터) 및 빅테크 기업들의 값비싼 독점적 "초지능" 모델들과 비교되었습니다.
  • 결과: MARS는 인간의 예시로 사전 학습된(SFT) 더 큰 모델들을 이겼습니다. 심지어 인간의 가이드 없이도 가장 진보된 상용 모델들의 성능에 매우 근접했습니다.

이 논문의 핵심 의의

논문에 따르면, 비결은 단순히 더 많은 도구(검색 엔진이나 계산기 등)를 갖는 것이 아니라, 바로 파트너십에 있습니다.

  • "정찰병(시스템 1)"이 없다면, "사색가"는 너무 많은 가공되지 않은 데이터에 압도되어 실수를 저지르게 됩니다.
  • "사색가(시스템 2)"가 없다면, "정찰병"은 실제 문제를 해결하는 것이 아니라 단순히 요약만 하게 됩니다.
  • 이 둘이 함께할 때, 시스템은 방대한 양의 최신 정보를 읽고 복잡한 다단계 추론 문제를 효율적으로 해결할 수 있습니다.

요약하자면, MARS는 AI에게 언제 "빠르게 스캔"하고 언제 "깊게 생각"해야 하는지, 그리고 어떻게 혼란 없이 두 가지를 함께 수행할 수 있는지를 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →