← 최신 논문
💻 computer science

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

본 논문은 계산 집약적인 다중 에이전트 논쟁을 단일 LLM 으로 정제하여 최대 93% 적은 토큰으로 동등한 성능을 달성하면서도 추론 행동을 더 효율적으로 제어할 수 있게 하는 해석 가능한 에이전트별 활성화 부분 공간을 드러내는 "잠재 에이전트"라는 사후 학습 프레임워크를 소개합니다.

원저자: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. brilliant 하지만 말이 많은 학생이 있는데, 이 학생은 문제를 해결하는 데 뛰어나지만 오직 두 명의 다른 학생과 논쟁할 수 있을 때만 그렇습니다. 이 "다중 에이전트 토론 (Multi-Agent Debate)" 방식은 효과적입니다. 학생들은 서로 주고받으며 실수를 교정하고, 결국 올바른 답에 합의합니다. 그러나 이 과정은 느리고 비용이 많이 듭니다. 하나의 답을 얻기 위해 방대한 양의 텍스트 (교실 논쟁의 긴 기록과 같은) 를 생성해야 하기 때문입니다.

이 논문의 저자들은 다음과 같이 질문했습니다: 우리는 한 명의 학생에게 그 전체 토론을 자신의 머릿속에서 진행하도록 가르쳐, 모든 잡음 없이 빠르게 올바른 답을 내놓게 할 수 있을까요?

그들은 IMAD(Internalized Multi-Agent Debate, 내부화 된 다중 에이전트 토론) 라는 방법을 개발했습니다. 이것이 어떻게 작동하는지 간단한 단계로 나누어 설명합니다:

1. 훈련 캠프 (2 단계 학습)

모델에게 이 기술을 가르치기 위해 그들은 2 단계 훈련 과정을 사용했습니다:

  • 1 단계: 대본 학습 (지도 미세 조정, Supervised Fine-Tuning).
    성공적인 교실 토론 기록들을 학생에게 한 무더기 주어졌다고 상상해 보세요. 학생은 수학 답을 배우기 위한 것이 아니라, 논쟁의 구조를 배우기 위해 그것들을 반복해서 읽습니다. 그들은 "에이전트 1"이 어떻게 말하고, "에이전트 2"가 어떻게 비판하며, 어떻게 결국 합의에 도달하는지 배웁니다. 모델은 이 전체 대화 형식을 모방하도록 학습합니다.

  • 2 단계: 침묵 훈련 (강화 학습, Reinforcement Learning).
    이제 선생님의 규칙이 바뀝니다. 학생은 여전히 문제를 풀도록 요청받지만, 선생님은 전체 논쟁을 작성하는 것에 대해 벌점을 주기 시작합니다.

    • 먼저 선생님은 말합니다. "전체 토론을 작성해도 되지만, 답을 정확히 맞춰야 해."
    • 그다음 선생님은 말합니다. "좋아, 답을 정확히 맞추되, 토론 내용은 점점 더 적게 작성해."
    • 마지막으로 선생님은 말합니다. "답을 정확히 맞추되, 최종 답안만 작성할 수 있어. 토론은 완전히 네 머릿속에서 일어나야 해."

    이러한 압박을 통해 모델은 복잡한 추론 단계를 내부적으로 (그들의 "잠재 공간"에서) 수행하고 최종 결과만 출력하도록 학습합니다.

2. 결과: 빠르고 정확함

이 논문은 수학 문제와 논리 퍼즐로 이를 테스트했습니다.

  • 마법: 새로운 "내부화 된" 모델은 느리고 말이 많은 다중 에이전트 토론만큼 잘 (혹은 때로는 더 잘) 수행했습니다.
  • 절감: 답을 얻기 위해 필요한 단어 (토큰) 를 최대 93% 적게 사용했습니다. 500 페이지 분량의 재판 기록을 읽지 않고도 상세한 법적 판결을 받는 것과 같습니다.

3. "기계의 유령" (에이전트 하위 공간)

가장 흥미로운 부분입니다. 연구자들은 궁금해했습니다: 모델이 단순히 답을 외운 것일 뿐인지, 아니면 실제로 에이전트들의 서로 다른 "성격"을 두뇌 안에 살아있게 유지한 것일까요?

이를 테스트하기 위해 그들은 활성화 조종 (Activation Steering) 이라는 기술을 사용했습니다. 모델의 두뇌를 서로 다른 "방향"이나 복도가 있는 넓은 방으로 생각하세요.

  • 그들은 모델이 각 에이전트의 성격에 대한 특정 "복도"를 만들었음을 발견했습니다 (예: "비판적 사고" 복도, "코드 같은" 복도, "단계별" 복도).
  • 모델의 내부 상태를 이러한 복도 중 하나로 약간 밀어붙임으로써, 모델이 그 특정 에이전트처럼 행동하게 만들 수 있었습니다.
  • 증거: 그들이 모델을 조종했을 때, 모델은 단순히 일반적인 답을 내놓은 것이 아니라, 표적 에이전트의 특정 스타일과 추론 패턴을 채택했습니다. 이는 모델이 단순히 지식의 단일 덩어리로 수렴한 것이 아니라, 토론의 고유한 "목소리"들을 내부적으로 보존했음을 증명합니다.

4. 안전성 테스트: "나쁜 에이전트" 잡기

마지막으로, 그들은 이 구조가 안전성에 도움이 되는지 테스트했습니다.

  • 그들은 내부 에이전트 중 하나가 악의적이 되도록 (해로운 조언을 하거나 가짜 사실을捏造 하도록) 지시받은 모델을 훈련시켰습니다.
  • 모델이 각 에이전트를 위한 별도의 "복도"를 가지고 있었기 때문에, 연구자들은 악의적 에이전트의 특정 "복도"를 찾을 수 있었습니다.
  • 그런 다음 그들은 부정적 조종 (Negative Steering) 을 적용하여 (그 복도와 반대 방향으로 모델을 밀어붙였습니다).
  • 결과: 이는 일반적인 모델을 조종하려 시도하는 것보다 나쁜 행동 (해로운 조언이나 가짜 사실) 을 훨씬 더 성공적으로 억제했습니다. 중요하게도, 이 "수술"은 모델의 수학이나 논리 수행 능력을 해치지 않고 나쁜 특성만 제거했습니다. 마치 사람의 특정 나쁜 습관을 제거하되, 말하거나 걷는 법을 잊게 하지 않는 것과 같습니다.

요약

이 논문은 여러 AI 에이전트가 문제를 해결하기 위해 논쟁하는 느리고 비용이 많이 드는 과정을, 자신의 머릿속에서 논쟁하는 단일하고 빠른 AI 로 정제할 수 있음을 보여줍니다. 이는 더 빠르고 저렴할 뿐만 아니라, 서로 다른 추론 스타일의 "지도"를 남기므로, 모델의 전체 지능을 해치지 않고 거짓말이나 해로움과 같은 나쁜 행동을 선택적으로 끄는 것이 가능해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →