← 최신 논문
💬 NLP

ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind

이 논문은 마음 이론(Theory of Mind) 모듈을 통합하여 상대방의 정신 상태를 동적으로 모델링함으로써 LLM 설득자의 능력을 향상시키고, 이를 통해 모델이 더 다양하고 논리적이며 상대방을 인지하는 논거를 제시함으로써 GPT-4o와 같은 훨씬 더 큰 규모의 베이스라인 모델들을 유의미하게 능가할 수 있게 하는 새로운 3B 파라미터 프레임워크인 ToMAP을 소개한다.

원저자: Peixuan Han, Zijia Liu, Jiaxuan You

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peixuan Han, Zijia Liu, Jiaxuan You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI에게 "분위기 읽는 법" 가르치기

당신이 토론 클럽에 있다고 상상해 보세요. 여기 두 종류의 토론자가 있습니다:

  1. 로봇: 이 로봇은 대본을 가지고 있습니다. 당신이 무슨 말을 하든, 로봇은 자신의 핵심 주장만 점점 더 크게 반복합니다. 당신이 "나 채소 싫어해"라고 말하면, 로봇은 "하지만 채소는 건강에 좋아요!"라고 답합니다. 당신이 "나 요리하기 싫어"라고 말해도, 로봇은 "하지만 채소는 건강에 좋아요!"라고 합니다. 로봇은 결코 태도를 바꾸지 않습니다.
  2. 사람: 사람은 당신의 말을 듣습니다. 당신이 "나 채소 싫어해"라고 말하면, 사람은 *"아, 맛을 싫어하는구나"*라고 생각합니다. 그래서 전략을 바꿉니다: "그럼 마늘과 함께 구워 먹으면 어때요? 그러면 사탕처럼 맛있어져요." 만약 당신이 "나 요리하기 싫어"라고 말하면, 사람은 "그럼 미리 손질된 걸 사는 건 어때요?"라고 제안합니다.

이 논문은 현재의 거대 언어 모델(LLM)들이 주로 **'로봇'**처럼 행동한다고 주장합니다. 이들은 텍스트를 생성하는 데는 뛰어나지만, 타인이 무엇을 생각하고, 느끼고, 믿고 있는지를 이해하는 능력인 **'마음 이론(Theory of Mind)'**에는 매우 취약합니다.

ToMAP(Theory of Mind Augmented Persuader)은 이 로봇을 인간 같은 토론자로 만들기 위해 설계된 새로운 학습 방법입니다. 이 방식은 아주 작은 AI(GPT-4 같은 거인들에 비하면 고작 30억 개의 파라미터 수준)가 어떻게 "분위기를 읽고" 역동적으로 자신의 논거를 조정할 수 있는지 가르칩니다.


ToMAP의 작동 원리: 두 가지 "초능력"

AI에게 이러한 인간적인 직관을 부여하기 위해, 연구진은 대화 중에 정신적 '치트 시트' 역할을 하는 두 가지 특수 모듈을 제공했습니다.

1. "수정구슬" (반론 예측기 - Counterclaim Predictor)

  • 문제점: 인간은 자연스럽게 *"내가 X라고 말하면, 상대방은 Y라고 생각하겠지?"*라고 생각합니다. 현재의 AI는 이를 놓치는 경우가 많습니다. 그들은 그저 자신의 대본에만 집착합니다.
  • 해결책: AI는 말을 하기 전에, "수정구슬"을 사용하여 상대방의 마음을 시뮬레이션합니다. 스스로에게 묻는 것입니다: "상대방이 내 의견에 반대할 만한 세 가지 이유는 무엇일까?"
  • 비유: 체스를 두는 것을 상상해 보세요. 그랜드마스터는 단순히 자신의 다음 수를 보는 것이 아니라, 판을 보고 *"내가 여기로 움직이면, 상대방은 저기로 움직이겠지"*라고 생각합니다. 수정구슬은 AI가 언어를 통해 이와 똑같은 일을 할 수 있게 해줍니다. 즉, 반론이 실제로 발생하기 전에 이를 미리 예측하는 것입니다.

2. "감정 레이더" (상대방 태도 예측기 - Opponent Attitude Predictor)

  • 문제점: 설령 AI가 반론을 예측한다 하더라도, 상대방이 그 문제에 대해 얼마나 강하게 느끼는지는 알지 못합니다. 상대가 그저 약간 짜증이 난 상태인가요, 아니면 격분한 상태인가요?
  • 해결책: 이 도구는 레이더처럼 작동합니다. 대화 기록과 예측된 반론을 분석하여, 특정 지점에 대해 상대방이 얼마나 동의하거나 반대하는지에 대한 "점수"를 AI에게 제공합니다.
  • 비유: 영업사원을 생각해 보세요. 서툰 영업사원은 고객의 표정을 무시합니다. 유능한 영업사원은 고객의 얼굴을 살핍니다. 고객이 회의적인 표정을 지으면, 영업사원은 속도를 늦추고 더 자세히 설명합니다. 고객이 흥미를 보이면, 속도를 높입니다. "감정 레이더"는 AI에게 정확히 어떤 속도와 톤으로 조절해야 할지를 알려줍니다.

학습 방법: 실행하며 배우기 (강화 학습 - Reinforcement Learning)

AI에게 단순히 "공감해라"라고 말한다고 해서 그것이 제대로 작동할 수는 없습니다. 이 논문은 강아지를 간식으로 훈련시키는 것과 같은 **강화 학습(RL)**을 사용합니다.

  • 게임: AI는 다른 AI를 상대로 토론 게임을 벌입니다.
  • 목표: 목표는 단순히 말을 하는 것이 아니라, 상대방의 마음을 바꾸는 것입니다.
  • 보상: 상대방의 의견이 AI의 쪽으로 아주 조금이라도 기울면, AI는 "간식"(보상 점수)을 받습니다. 만약 AI가 같은 말을 반복하거나 루프에 빠지면, "꾸중"(벌점)을 받습니다.
  • 결과: 수천 번의 게임을 통해, AI는 간식을 얻기 위한 유일한 방법이 똑같은 말을 반복하는 것을 멈추고, "수정구슬"과 "감정 레이더"를 사용하여 독창적이고 맞춤화된 논거를 만드는 것임을 배웁니다.

놀라운 결과

이 논문에서 가장 흥고한 부분은 성능입니다.

  • 작은 모델 vs 거대한 모델: ToMAP 모델은 매우 작습니다(30억 파라미터). 이 모델이 이겨낸 "거인들"에는 GPT-4o나 700억, 심지어 6,710억 개의 파라미터를 가진 모델들이 포함됩니다.
  • 점수: ToMAP는 이러한 거대 모델들을 압도적인 차이로 앞질렀습니다(일부 테스트에서 약 39% 더 높은 성능).
  • 왜 그럴까요? 거대 모델들은 수백만 권의 책이 있지만 정리할 사서가 없는 도서관과 같습니다. 그들은 많은 사실을 알고 있지만, 특정 사람을 상대로 그 사실을 어떻게 전략적으로 사용할지는 모릅 믿습니다. 반면 ToMAP는 특정 고객에게 딱 맞는 책을 꺼내 줄 줄 아는 명석한 사서가 있는 작은 도서관과 같습니다.

실험의 핵심 요약

  1. 반복 감소: ToMAP가 없으면 AI는 똑같은 8단어를 계속 반복하는 경향이 있습니다(마치 고장 난 레코드판처럼). ToMAP는 상대방의 정신 상태를 끊임없이 확인하고 새로운 각도를 찾기 때문에 이러한 반복을 방지합니다.
  2. 긴 대화: 짧은 대화에서는 큰 모델들도 괜찮습니다. 하지만 10회 이상의 긴 대화로 가면, 큰 모델들은 지치고 반복적이 됩니다. ToMAP는 대화가 진행될수록 전략을 계속 조정하기 때문에 오히려 더 나아집니다.
  3. 감정보다 논리: 연구 결과, ToMAP는 "미사여구"(감정적 호소나 고함 등)의 사용을 멈추고 논리, 증거, 공통 분모를 찾는 방식을 사용했습니다. 이는 더 정교한 토론자가 되었음을 의미합니다.

요약

ToMAP는 AI에게 "고장 난 레코드판"이 되는 대신 "마음을 읽는 자"가 되는 법을 가르치는 프레임워크입니다. 상대방이 무엇을 생각하고 어떻게 느끼는지를 예측하는 도구를 제공하고, 실제로 마음을 바꾸는 것에 대해 보상을 주는 방식으로 훈련함으로써, 연구진은 세계에서 가장 크고 비싼 AI 모델들보다 더 설득력 있는 작고 효율적인 AI를 만들어냈습니다.

이는 전략과 인식이 단순히 거대한 뇌를 갖는 것보다 더 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →