← 최신 논문
🤖 machine learning

Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

이 논문은 목표 표류(objective drift)를 완화하고 역동적인 상호작용 환경에서 견고한 장기 의사결정을 달прав하기 위해 지도 미세 조정된 상위 수준의 플래너와 강화 학습 기반의 하위 수준 실행기를 결합한 계층적 다중 에이전트 프레임워크인 Multi2^2를 소개하며, 이와 함께 세 가지 새로운 벤치마크 데이터셋을 공개한다.

원저자: Sangeun Park, Minhae Kwon

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sangeun Park, Minhae Kwon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간 정신없는 로봇에게 비디오 게임의 복잡하고 다단계적인 과업을 수행하는 법을 가르치려 한다고 상상해 보세요. 예를 들어 목표가 "희귀한 식물을 찾아 물과 섞은 뒤 포션을 제조하라"는 것일 수 있습니다.

만약 당신이 로봇에게 그냥 "가서 해"라고 말하고 스스로 모든 움직임을 파악하게 내버려 둔다면, 로봇은 종종 혼란에 빠집니다. 로봇은 포션이 무엇을 위한 것이었는지 잊어버리거나, 제자리에서 뱅뱅 돌기 시작하거나, 물을 섞는 대신 물을 마시려고 할 수도 있습니다. 연구 분야에서는 이를 **"목표 표류(objective drift)"**라고 부릅니다. 즉, 로봇이 명확한 목표를 가지고 여정을 시작했지만, 도중에 무엇을 해야 하는지 놓쳐버리는 현상을 말합니다.

이 논문은 이 문제를 해결하기 위해 Multi2라는 새로운 시스템을 소개합니다. Multi2를 단일한 로봇이 아니라, 마치 상사와 숙련된 기술공처럼 함께 일하는 두 명의 전문화된 작업자 팀이라고 생각해보세요.

두 명의 작업자: 상사와 기술공

1. 상사 (System 1): "큰 그림"을 그리는 기획자

  • 하는 일: 이 작업자는 컨트롤러를 만지지 않습니다. 대신 큰 목표를 바라보고 이를 작고 관리 가능한 덩어리로 나눕니다.
  • 비유: 당신이 집을 짓고 있다고 상상해 보세요. 상사는 건축가입니다. 그들은 벽돌을 쌓지 않습니다. 대신 설계도를 그리고 이렇게 말합니다. "먼저 기초를 다져야 합니다. 기초가 완료되면 벽을 세울 것입니다."
  • 학습 방법: 상사는 수천 개의 좋은 설계도 예시를 보여줌으로써 학습합니다(이를 **지도 미세 조정(Supervised Fine-Tuning)**이라고 합니다). 그들은 팀이 결코 주요 목표를 놓치지 않도록 명확하고 맥락을 고려한 지침을 내리는 법을 배웁니다.

2. 기술공 (System 2): "현장"에서 실행하는 실행자

  • 하는 일: 이 작업자는 실제로 도구를 들고 작업을 수행합니다. 그들은 상사의 지시("기초를 다져라")를 받아 그것을 실현하기 위해 정확히 어떤 버튼을 눌러야 하는지 파악합니다.
  • 비유: 기술공은 건설 현장 인력입니다. 이들은 직접 몸을 움직이며 진흙을 다루고, 콘크리트 양동이가 쏟아졌을 때 문제를 해결하는 사람들입니다.
  • 학습 방법: 기술공은 두 단계로 학습합니다:
    • 1단계 (오프라인): 그들은 실제 실수를 저지르지 않고 기초를 배우기 위해 과거의 건설 영상 라이브러리를 공부합니다.
    • 2단계 (온라인): 그들은 실제 세상(게임 환경)으로 나가 연습합니다. 만약 실수를 하면 즉시 그로부터 배웁니다. 결정적으로, 그들은 너무 멋대로 행동하여 기초를 잊어버리지 않도록 라이브러리에서 배운 내용에 가깝게 머물도록 교육받습니다. 이를 **오프라인-투-온라인 강화 학습(Offline-to-Online Reinforcement Learning)**이라고 합니다.

왜 이 팀이 더 효과적인가

이 논문은 기존 방식들이 하나의 로봇에게 계획과 실행을 모두 하도록 시켰다고 주장합니다. 이것은 건축가에게 벽돌을 하나하나 쌓으라고 요구하는 것과 같습니다. 그것은 너무 많은 작업이며, 건축가는 못을 박으려고 애쓰는 동안 설계도를 잊어버리기 쉽습니다.

Multi2는 역할을 분리함으로써 이 문제를 해결합니다:

  • 안정성: 상사(System 1)가 계획에 특화되어 있기 때문에, 작업이 오래 걸리더라도 팀은 결코 주요 목표를 놓치지 않습니다.
  • 효율성: 기술공(System 2)은 연습을 통해 특정 동작에 능숙해집니다. 이는 로봇이 일을 완수하기 위해 굳이 "생각"을 많이 하거나 많은 컴퓨터 단어(토큰)를 사용할 필요가 없음을 의미합니다. 이는 숙련된 목수가 한 번의 매끄러운 동작으로 판자를 자르는 것과 같으며, 초보자는 계속해서 측정하고 다시 측정해야 하는 것과는 대조적입니다.

결과

연구진은 다단계 과업이 필요한 세 가지 "비디오 게임" 세계(ScienceWorld, ALFWorld, TextCraft)에서 이 팀을 테스트했습니다.

  • 더 높은 성공률: Multi2는 다른 방법들보다 더 많은 과업을 해결했습니다. 특히 다른 로봇들이 보통 포기하거나 혼란에 빠지는 길고 어려운 과업에서 그러했습니다.
  • 적은 혼란: 다른 로봇들이 무의미한 행동을 반복하며 루프(loop)에 빠질 때, Multi2는 궤도를 유지했습니다.
  • 에너지 절약: Multi2는 동일한 결과를 얻기 위해 더 적은 컴퓨터 자원(토큰)을 사용했으며, 이는 더 빠르고 효율적임을 의미합니다.

"비법(Secret Sauce)"

논문은 또한 이 상사와 기술공의 팀워크를 가르치기 위해 특별히 설계된 새로운 학습 데이터(로봇을 위한 새로운 교과서와 같은 것)를 공개했습니다. 그들은 만약 학습 내용을 섞어서—예를 들어 상사에게 벽돌 쌓는 법을 가르치거나 기술공에게 설계도 그리는 법을 가르치면—시스템이 실패한다는 것을 발견했습니다. 구체적인 역할은 반드시 분리되어야 하며 각자의 직무에 맞게 특화되어 학습되어야 합니다.

요약하자면, Multi2는 단순히 긴 과업을 헤쳐나가기 위해 "추측"하는 에이전트를 만드는 것이 아니라, 목표를 주시하는 명확한 관리자와 경험으로부터 배워 효율적으로 일을 완수하는 숙련된 작업자를 갖춘 AI 에이전트를 구축하는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →