← 최신 논문
🤖 AI

Multi-Agent LLMs Fail to Explore Each Other

이 논문은 현대의 LLM 에이전트들이 다중 에이전트 환경에서 서로를 효과적으로 탐색하는 데 실패하여 차선의 협업으로 이어진다는 근본적인 한계를 식별하고, 구조화된 동료 선택을 명시적으로 촉진함으로써 탐색 행동과 작업 성능을 크게 향상시키는 다중 에이전트 맥락적 탐색(MACE) 프레임워크를 제안한다.

원저자: Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 우주선의 선장이라고 상상해 보세요. 하지만 당신은 별들을 볼 수 없습니다. 당신에게는 열 명의 서로 다른 부선장들(이들을 "피어(Peers)"라고 부릅시다)이 있고, 당신의 임무는 그들 중 누가 목적지로 가는 길을 알고 있는지 알아내는 것입니다. 문제는 무엇이 문제냐고요? 당신은 누가 항해에 능숙한지, 누가 요리에 능숙한지, 아니면 누가 그저 운 좋게 때려 맞추는 데 능숙한지를 모른다는 점입니다. 당신은 그들에게 길을 물어보고, 그들의 대답을 듣고, 다음 여정을 위해 누구를 신뢰할지 결정해야 합니다.

이것은 거대 언어 모델(LLM)이 함께 협업하려고 할 때 정확히 일어나는 현상입니다. 하지만 반전이 있습니다. 현재의 AI 에이전트들은 이 게임을 정말 못합니다.

"첫인상"의 함정

연구진은 수학 문제를 활용한 "무궁화 꽃이 피었습니다" 같은 간단한 테스트를 설정했습니다. 그들은 AI 에이전트에게 두 명의 잠재적 조력자, 즉 피어 A와 피어 B를 주었습니다. 한 명은 다른 한 명보다 수학을 약간 더 잘했지만, AI는 누가 더 나은지 몰랐습니다. AI는 조력자를 선택하고, 그가 정답을 맞혔는지 확인한 다음, 동일한 조력자를 계속 선택할지 아니면 그가 실제로 더 나은 선택인지 확인하기 위해 다른 조력자를 시도해 볼지 결정해야 했습니다.

완벽한 세상이라면 AI는 똑똑한 과학자처럼 행동할 것입니다. "A에게 몇 번 물어본 다음, B에게도 몇 번 물어봐서 누가 진짜 실력자인지 확인해 봐야지." 이것을 **탐색(exploration)**이라고 부릅니다.

하지만 실제 AI가 한 행동은 마치 문자 메시지 한 통에 바로 결론을 내려버리는 고집 센 십 대와 같았습니다. 연구 결과, 현대의 LLM(GPT-4나 GPT-5 같은 초고성능 모델조차도)은 처음 몇 라운드에서 피어를 선택하고, 운 좋게 정답을 얻으면, 그리고는 그 선택에 영원히 고착되어 버렸습니다. 그들은 탐색을 멈췄습니다. 다른 피어가 실제로 더 나은지 확인하지 않았습니다. 그들은 첫 번째 추측에 매달렸고, 설령 그것이 틀렸을지라도 말입니다.

연구진은 이를 "조기 확정(premature commitment)"이라고 부릅니다. 이는 새로운 식당에서 버거를 주문하고 한 입 먹은 뒤, 평생 버거만 먹기로 결정하는 것과 같습니다. 그 옆에 있는 피자가 훨씬 더 맛있을 수도 있는데 말이죠.

"마법의 프롬프트"는 통하지 않는다

당신은 이렇게 생각할지도 모릅니다. "그래, AI에게 '제발 다른 사람도 좀 시도해 봐!'라고 친절하게 말해주면 되지 않을까?" 연구진은 이 방법을 시도했습니다. 그들은 AI에게 새로운 것을 시도하는 것(탐색)과 효과적인 것에 집중하는 것(활용) 사이의 균형을 맞추라고 명시적으로 요청하는 프롬프트를 주었습니다.

결과는 어땠을까요? 도움이 되지 않았습니다. 사실, 탐색하라는 지시를 받은 AI가 단순히 무작위로 조력자를 선택했을 때보다 성적이 더 나쁜 경우도 있었습니다. 이는 당신이 AI에게 호기심을 가지라고 "말"한다고 해서 해결될 문제가 아님을 시사합니다. 문제는 그들이 지시를 이해하지 못하는 것이 아니라, 그들의 내부적인 뇌 구조가 이러한 신중한 통계적 추측을 자연스럽게 지원하지 않는다는 데 있습니다.

해결책: MACE (스마트 스카우트)

AI 스스로 이 문제를 해결할 수 없기 때문에, 저자들은 MACE(Multi-Agent Contextual Exploration)라는 가벼운 도구를 만들었습니다. MACE를 AI 옆에 앉아 있는 "스마트 스카우트(Smart Scout)"라고 생각하세요.

AI가 누구와 대화할지 스스로 추측하게 두는 대신, MACE는 "컨텍스추얼 밴딧(contextual bandits)"이라 불리는 간단한 수학적 기법을 사용하여 AI가 선택지를 확인하도록 강제합니다. MACE는 다음과 같은 점수를 기록합니다. "당신은 피어 A와 많이 대화했지만, 피어 B와는 거의 대화하지 않았습니다. 피어 B는 다른 관점을 가지고 있을 수도 있습니다." MACE는 단순히 친절하기 위해서가 아니라, 수학적으로 그것이 최선의 파트너를 찾는 유일한 방법이기 때문에, 테스트가 덜 된 피어와 대화하도록 AI를 유도합니다.

다양성이 중요한 이유

이 발견의 가장 멋진 부분은 이것입니다. 연구진은 AI 에이전트들이 서로 얼마나 다른지에 따라 이 "스마트 스카우트"의 중요성이 커진다는 것을 발견했습니다.

모두가 똑같은 사람들(예를 들어 똑같은 복제 인간 열 명)로 구성된 팀을 상상해 보세요. 누구를 선택하든 상관없습니다. 그들은 모두 같은 답을 내놓을 테니까요. 하지만 현실 세계에서 에이전트들은 서로 다릅니다. 어떤 이는 수학에 능하고, 어떤 이는 역사에, 또 어떤 이는 창의적 글쓰기에 능할 수 있습니다. 논문은 에이전트들이 매우 다양할수록, 잘못된 선택을 했을 때의 비용이 막대해진다는 것을 보여줍니다.

그들은 만약 에이전트들이 서로 매우 다르다면, 탐색하지 않는 AI는 처참하게 실패하며 시간이 흐를수록 점점 더 나빠질 것이라는 점을 수학적으로 증명했습니다. 하지만 MACE를 사용하는 AI는 궤도를 유지합니다. 탐색의 "가치"는 팀이 더 다양해질수록 커집니다.

핵심 요약

이 논문은 이것이 모든 AI 시나리오에 대한 해결책이라고 주장하는 것은 아니지만, 실험을 통한 증거는 강력합니다. 그들은 다음을 입증했습니다:

  1. 현재의 AI 에이전트는 탐색에 실패한다: 그들은 첫 번째 선택에 갇혀버리며, 심지어 그것이 틀렸을 때도 마찬가지입니다.
  2. 프롬프트만으로는 부족하다: 단순히 호기심을 가지라고 말하는 것만으로는 안 됩니다. 구조적인 유도가 필요합니다.
  3. MACE는 작동한다: 누가 대화할지를 안내하는 간단한 알고리즘을 사용함으로써, 에이전트들은 더 나은 파트너를 찾고 문제를 훨씬 더 잘 해결합니다.
  4. 다양성이 핵심이다: 에이전트들이 서로 다를수록, 그들은 성공을 위해 이러한 가이드된 탐색을 더욱 필요로 합니다.

요컨대, 만약 당신이 AI 에이전트 팀이 안정적으로 작동하기를 원한다면, 단순히 그들이 대화를 나누며 스스로 알아내기를 기다려서는 안 됩니다. 어떤 경로가 보물로 이어지는지 모든 경로를 확인하도록 강제하는 지도를 반드시 주어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →