← 최신 논문
💬 NLP

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

이 논문은 다양한 모델의 전문성을 활용하기 위해 오케스트레이터 보정 및 에이전트 자기 평가 메커니즘을 도입한 이질적 다중 에이전트 시스템 'Team-of-Thoughts'를 제안하며, 수학적 추론 및 코드 생성 벤치마크에서 기존 동질적 시스템보다 뛰어난 성능을 입증합니다.

원저자: Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 "생각의 팀 (Team-of-Thoughts)": AI 가 함께 일할 때 더 똑똑해지는 비결

이 논문은 **"단일한 거인 AI 하나만 믿는 것보다, 각자 다른 재능을 가진 AI 들을 한 팀으로 꾸려서 문제를 해결하는 것이 훨씬 효율적이고 강력하다"**는 아이디어를 제시합니다.

기존의 AI 시스템은 보통 같은 모델 (예: 같은 회사의 같은 버전) 을 여러 번 돌려서 답을 찾거나, 고정된 역할만 맡겼습니다. 하지만 이 논문은 **"서로 다른 전문성을 가진 AI 들을 '도구'처럼 상황에 맞게 불러모아, 한 명의 지휘자가 (Orchestrator) 최적의 조합을 만들어내는 방식"**을 제안합니다.

이 복잡한 개념을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 기존 방식의 문제점: "똑같은 사람 10 명을 부르는 것"

지금까지의 많은 AI 시스템은 마치 "같은 전공을 가진 학생 10 명을 모아놓고, 모두에게 똑같은 문제를 풀게 하는" 것과 비슷했습니다.

  • 단점: 모두 같은 방식으로 생각하고, 같은 실수를 할 수 있습니다. 만약 그 학생이 수학은 잘하지만 코딩은 못 한다면, 코딩 문제를 풀 때도 계속 같은 실수를 반복할 뿐입니다.

2. 새로운 방식: "다양한 전문가들이 모인 '생각의 팀'"

이 논문이 제안하는 Team-of-Thoughts는 **"다양한 분야의 전문가들이 모여 있는 컨설팅 팀"**을 상상해 보세요.

  • 상황: 복잡한 문제를 해결해야 할 때, 팀장은 (Orchestrator) 문제의 성격을 파악합니다.
  • 행동: "이건 수학 문제네? 수학 전공자 (A 모델) 와 논리 전공자 (B 모델) 를 불러와!"라고 말합니다. 반면, "이건 코딩 문제야? 프로그래머 (C 모델) 가 필요해!"라고 다른 사람을 부릅니다.
  • 핵심: 모든 전문가가 다 같이 일하는 게 아니라, 문제에 가장 적합한 전문가들만 골라서 부르는 것입니다.

3. 이 시스템의 두 가지 핵심 비밀

🔍 비밀 1: "팀장 선발 시험" (Orchestrator Calibration)

누가 팀장 (지휘자) 을 맡을지 정하는 과정입니다.

  • 비유: 단순히 "가장 지능이 높은 사람"을 팀장으로 뽑는 게 아닙니다. 어떤 사람은 혼자 문제를 풀 때는 천재지만, 다른 사람을 지휘하거나 정보를 종합하는 데는 서툴 수 있습니다.
  • 방식: 이 시스템은 각 AI 모델이 **"다른 AI 들의 답변을 잘 종합하고 지휘할 수 있는 능력"**을 미리 시험해 봅니다. 수학 문제에는 수학에 강한 AI 를, 코딩에는 코딩에 강한 AI 를 팀장으로 뽑아줍니다.

📝 비밀 2: "자기 평가서" (Agent Self-Assessment)

각 전문가 (Tool Agents) 가 스스로를 분석하는 과정입니다.

  • 비유: 각 AI 가 "저는 수학 문제에는 90% 정도 잘 풀지만, 복잡한 문장 해석에는 약해요"라고 **자기소개서 (프로필)**를 작성합니다.
  • 방식: 팀장은 이 자기소개서를 보고, "아, 이 문제는 수학이 핵심이니까 '수학 잘하는 AI'를 부르고, '문장 해석이 약한 AI'는 부르지 말아야겠다"라고 판단합니다. 이렇게 하면 쓸데없는 AI 를 부르는 비용과 시간을 아낄 수 있습니다.

4. 왜 이렇게 하면 더 잘될까요? (결과)

이 논문은 수학 문제 (AIME) 와 코딩 문제 (LiveCodeBench) 에서 이 방식을 테스트했습니다.

  • 결과: 단일 모델이나 기존 방식보다 정확도가 훨씬 높았습니다. (예: 수학 문제에서 80% → 96% 로 급상승!)
  • 이유:
    1. 다양한 시각: 서로 다른 AI 는 서로 다른 방식으로 문제를 바라보기 때문에, 하나의 답만 고집하지 않고 더 넓은 해결책을 찾을 수 있습니다.
    2. 비용 효율성: 모든 AI 를 다 부르는 게 아니라, 필요한 사람만 부르기 때문에 돈과 시간이 절약됩니다.
    3. 오류 수정: 한 AI 가 실수해도, 다른 AI 가 그 실수를 보완해 줄 수 있습니다.

5. 주의할 점: "팀이 너무 크면 혼란스러워요"

논문의 마지막 부분에서 흥미로운 사실을 발견했습니다.

  • 비유: 전문가를 2 명만 부르면 팀장이 잘 지휘하지만, 전문가를 100 명이나 한꺼번에 부르면 팀장이 누구를 먼저 불러야 할지 고민하다가 오히려 실수를 저지릅니다.
  • 교훈: AI 팀의 크기를 무작정 키우는 것보다, 상황에 맞춰 딱 필요한 수 (예: 2~4 명) 의 전문가만 골라서 부르는 것이 가장 효율적입니다.

📝 한 줄 요약

"하나의 거대한 AI 에게 모든 일을 맡기는 것보다, 각자 다른 재능을 가진 여러 AI 들을 '상황별 전문가'로 뽑아 팀장에게 지휘하게 하면, 더 빠르고 정확하게 문제를 해결할 수 있다."

이 방식은 앞으로 AI 가 더 복잡하고 다양한 문제를 해결할 때, 비용을 아끼면서도 최고의 성능을 내는 새로운 표준이 될 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →