← 최신 논문
🤖 AI

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

이 논문은 다중 페르소나 토론가(multi-persona debaters)를 활용하여 다양한 성찰을 생성하고 단일 에이전트 자기 성찰에서 나타나는 사고 퇴화(thought degeneration)를 극복함으로써 HotPot QA 및 HumanEval과 같은 작업에서 추론 성능을 크게 향상시키는 방법인 MAR(Multi-Agent Reflexion)을 제안한다.

원저자: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

논문 설명: MAR (Multi-Agent Reflexion), LLM의 추론 능력을 향상시키는 다중 에이전트 성찰

핵심 문제: AI의 "에코 체임버(Echo Chamber, 메아리 방)" 현상

당신이 매우 어려운 퍼즐을 풀고 있다고 상상해 보세요. 실수를 했지만, 친구에게 도움을 요청하는 대신 스스로 자신의 실수를 바라보고, 무엇이 잘못되었는지 스스로에게 노트를 쓰고 다시 시도해야만 하는 상황입니다.

이것이 기존의 Reflexion 시스템이 작동하는 방식입니다. 마치 혼자 방 안에서 시험을 치르는 학생과 같습니다. 문제를 틀리면, 학생은 "세부 사항을 놓쳐서 틀렸다"라고 적은 뒤 다시 시도합니다.

연구진은 이 접근 방식의 중대한 결함을 발견했습니다: 학생이 자신의 사고방식에 너무 갇혀 있다는 점입니다.

  • 만약 학생이 규칙을 오해해서 실수를 했다면, 스스로 작성한 노트는 그 오해를 그대로 반복하는 경우가 많습니다.
  • 결국 학생은 똑같은 실수를 반복하며, 단지 표현만 조금씩 바꿔서 정당화하는 "에코 체임버"에 갇히게 됩니다.
  • 논문의 기술적 용어로는 이를 **"사고의 퇴행(degeneration of thought)"**이라고 합니다. AI가 잘못된 추론의 루프에 빠져버리는 것입니다.

해결책: "전문가 패널"

이를 해결하기 위해 저자들은 **Multi-Agent Reflexion (MAR)**을 만들었습니다.

단 한 명의 학생이 혼자 대화하는 대신, 이제 AI는 문제를 해결하기 위해 테이블에 둘러앉은 전문가 팀이 됩니다. 팀이 실수를 했을 때, 그들은 단순히 노트를 쓰는 것이 아니라 구조화된 토론을 벌입니다.

새로운 시스템의 작동 단계는 다음과 같습니다:

  1. Actor (수행자): 한 명의 AI가 먼저 문제를 해결하려고 시도합니다.
  2. Failure (실패): 만약 답이 틀렸다면, 시스템은 단순히 "수행자"에게 수정하라고 요구하는 데 그치지 않습니다.
  3. Debate (토론 - 비평가들): 시스템은 다양한 "페르소나"(특화된 AI 캐릭터) 팀을 호출합니다. 이들은 마치 다음과 같습니다:
    • Skeptic (회의론자): 모든 것을 의심하며 숨겨진 함정을 찾아내는 사람.
    • Logician (논리학자): 단계들이 수학적으로 실제로 타당한지 확인하는 사람.
    • Creative (창의가): 기발하고 대안적인 아이디어를 제안하는 사람.
    • Verifier (검증자): 답변이 정확한 규칙과 일치하는지 확인하는 사람.
  4. Judge (판사): "판사" AI는 이 다양한 전문가들이 논쟁하는 것을 듣습니다. 판사는 단순히 승자를 고르는 것이 아니라, 이들의 논거를 종합하여 하나의 명확하고 수준 높은 교훈으로 만들어냅니다.
  5. Retry (재시도): "수행자" AI는 이 새롭고 풍부해진 교훈을 전달받아 다시 시도합니다. 교훈이 다양한 집단으로부터 왔기 때문에, 이전의 실수를 반복하는 대신 진짜 실수가 무엇인지 찾아낼 가능성이 훨씬 높습니다.

결과: 효과가 있는가?

연구진은 두 가지 매우 다른 유형의 과제로 테스트를 진행했습니다.

  • "탐정" 테스트 (HotPotQA): 여러 서로 다른 문서에서 단서들을 연결하여 질문에 답해야 하는 작업입니다.

    • 결과: 단일 AI 시스템(Reflexion)은 약 **44%**의 정답률을 보였습니다. 새로운 "전문가 패널" 시스템(MAR)은 **47%**의 정답률을 기록했습니다.
    • 참고: 저자들은 이 개선 폭이 기대보다 작았음을 인정했는데, 이는 채점 시스템이 마침표 하나가 빠지는 것과 같은 아주 미세한 형식적 디테일에 매우 엄격하여, 올바른 추론을 했음에도 감점이 되었기 때문입니다.
  • "코더" 테스트 (HumanEval): 숨겨진 테스트를 통과해야 하는 컴퓨터 코드를 작성하는 작업입니다.

    • 결과: 단일 AI 시스템은 **76.4%**의 코드가 정상 작동했습니다. 새로운 "전문가 패널" 시스템은 **82.6%**가 작동했습니다.
    • 왜 더 효과적이었는가: 코딩 오류는 종로 종종 논리적 루프나 'off-by-one'(경계값 오류) 실수인 경우가 많습니다. "회의론자"와 "논리학자" 페르ola는 단일 AI가 계속 놓치던 이러한 특정 유형의 오류를 잡아내는 데 매우 뛰어났습니다.

주의점: 더 많은 비용이 듭니다

논문은 단점 또한 솔직하게 밝히고 있습니다.

  • 토론의 대가: 팀 전체가 토론하는 것은 한 사람이 혼자 생각하는 것보다 훨씬 더 많은 에너지와 시간이 소요됩니다.
  • 비용: 새로운 시스템은 여러 AI 모델을 실행하여 토론을 진행해야 하므로, 기존 시스템보다 약 3배 더 많은 컴퓨팅 파워(그리고 3배 더 많은 API 비용)를 사용합니다.

요약

이 논문은 AI가 점점 똑똑해지고 있지만, 여전히 자신의 습관에 갇혀 스스로의 실수로부터 배우는 데 어려움을 겪고 있다고 주장합니다. AI에게 자신의 다른 버전들과 논쟁하도록 강제함으로써, AI는 이러한 나쁜 습관에서 벗어나 더 나은 해결책을 찾고 더 신뢰할 수 있게 됩니다. 다만, 이는 더 높은 비용을 수반합니다.

이는 혼자서 그림을 수정하려는 단독 예술가와, 무엇이 잘못되었고 어떻게 고쳐야 하는지 정확히 지적해 주는 전체 미술 비평 팀의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →