← 최신 논문
🤖 AI

Differentiable Belief-based Opponent Shaping

본 논문은 하드코딩된 기만 목표에 의존하지 않고 kk-단계 소프트맥스-베이지안 신념 역학을 통해 미분함으로써 다중 에이전트 전략을 최적화하여 자연스럽게 상대방의 신념을 형성하는 1 차 방법인 미분 가능 신념 기반 상대방 형성 (D-BOS) 을 제안하며, 이는 기존 베이스라인에 비해 숨겨진 역할 및 혼합 동기 게임에서 우수한 성능을 달성합니다.

원저자: Aarav G Sane, Karthik Sivachandran, Rohan Paleja

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aarav G Sane, Karthik Sivachandran, Rohan Paleja

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구들과 함께 복잡한 "마피아"나 "Among Us" 게임을 한다고 상상해 보세요. 이러한 게임에서는 모두에게 "스파이"나 "악당"과 같은 비밀 역할이 부여되며, 목표는 단순히 자신에게 최선의 수를 두는 것이 아니라 친구들이 당신을 어떻게 생각하는지 통제하는 것입니다.

너무 의심스러운 행동을 하면 그룹이 당신이 스파이임을 알아차리고 투표로 탈락시킵니다. 반면, 너무 순진하게 행동하면 팀을 방해할 기회를 놓칠 수 있습니다. 가장 똑똑한 플레이어들은 단순히 반응하는 것을 넘어, 자신이 누구인지에 대한 그룹의 "정신적 지도"를 적극적으로 형성하려 합니다.

이 논문은 AI 에이전트들이 정확히 이를 수행하는 방법을 가르치는 새로운 컴퓨터 프로그램인 D-BOS(Differentiable Belief-based Opponent Shaping, 미분 가능한 신념 기반 상대 형성) 를 소개합니다. 즉, 다른 플레이어들이 자신에 대해 믿는 바를 조작하는 것입니다.

간단한 비유를 사용하여 작동 원리를 살펴보면 다음과 같습니다:

1. 문제: "하드 코딩된" 장난꾸러기

과거의 기만용 AI 방법들은 엄격하고 멍청한 규칙서를 따르는 로봇과 같았습니다.

  • 구식 방법 (BBM): "내가 말할 때마다 반드시 사람들이 나를 순진한 사람이라고 생각하게 하라"는 하드코딩된 지시를 가진 로봇 스파이를 상상해 보세요. 이는 맹목적으로, 단계별로 이를 수행합니다.
  • 결함: 로봇이 순진해 보이려 노력하는 것이 너무 뻔하면 다른 플레이어들이 즉시 눈치챕니다. 마치 마술사가 계속 "나는 지금 분명히 트릭을 하지 않고 있습니다!"라고 말하는 것과 같습니다. 다른 플레이어들은 뭔가 수상하다는 것을 깨닫습니다.

2. 해결책: "전략적 인형극" (D-BOS)

저자들은 더 똑똑한 D-BOS 를 제안합니다. "기만하라"는 규칙을 따르는 대신, D-BOS 는 이렇게 질문합니다: "내 친구들은 5 수 뒤의 미래에 나에 대해 무엇을 믿게 될 것이며, 오늘 어떻게 행동해야 그 미래의 신념이 내가 승리하는 데 도움이 될까?"

D-BOS 를 미래를 볼 수 있는 체스 플레이어라고 생각하세요.

  • "신념"을 상태로서: 이 시스템에서 AI 는 단순히 게임 보드를 보는 것이 아니라 다른 플레이어들의 마음을 봅니다. AI 는 그들의 "신념"(예: "나는 에이전트 X 가 스파이라고 생각한다") 을 밀고 당길 수 있는 물리적 객체로 취급합니다.
  • "미분 가능한" 마법: "미분 가능한 (Differentiable)"이라는 단어는 수학 용어로, 본질적으로 AI 가 자신의 행동이 일으키는 정확한 파급 효과를 계산할 수 있음을 의미합니다. AI 는 머릿속에서 시뮬레이션을 실행합니다: "내가 행동 A 를 취하면 친구는 X 라고 생각할 것이다. 행동 B 를 취하면 그들은 Y 라고 생각할 것이다. 어떤 생각이 나중에 내가 게임을 이기는 데로 이어지는가?"

3. 작동 방식: "시간 여행 거울"

이 논문은 AI 가 "k-단계" 시뮬레이션을 펼치는 과정을 설명합니다.

  • 비유: 상대방이 무엇을 생각하는지 보여주는 거울을 들고 있다고 상상해 보세요. D-BOS 는 거울을 한 번만 보는 것이 아니라, 거울을 본 다음, 당신이 움직인 에 상대방이 무엇을 생각할지 상상하고, 그 다음에는 무엇을 생각할지 상상하는 식으로 미래의 몇 단계까지 이어갑니다.
  • 목표: 그런 다음 AI 는 거울 속의 이미지가 AI 가 승리할 수 있는 곳으로 가도록 이끄는, 지금 당장 취해야 할 완벽한 수를 찾기 위해 거꾸로 작업을 수행합니다.
  • 자연스러운 전략: 결정적으로 AI 는 "거짓말하라"는 지시를 받지 않습니다. 오직 "승리하라"는 지시만 받습니다. 거짓말이 승리하는 데 도움이 되면 거짓말을 하고, 진실이 승리하는 데 도움이 되면 (적의 신뢰를 얻어 속이기 위해) 진실을 말합니다. 전략은 기만하기 위한 경직된 규칙이 아니라, 승리하려는 욕구에서 자연스럽게 도출됩니다.

4. 결과: 나머지보다 더 똑똑함

저자들은 이 AI 를 세 가지 다른 "게임"에서 테스트했습니다:

  1. 장군 구조하기: 팀이 캐릭터를 구하거나 죽이려 하는 시각적 게임.
  2. 아발론: 숨겨진 역할이 있는 사회적 추리 게임 (마피아와 유사).
  3. 동전 게임: 숨겨진 동기가 있는 간단한 격자 게임.

연구 결과:

  • 구식 방법 (PPO): 표준 AI 는 잘 플레이했지만, 자신의 행동이 다른 사람의 마음을 어떻게 바꾸는지 제대로 이해하지는 못했습니다.
  • "하드 코딩된" 방법 (BBM): 매 단계마다 기만하려 했던 AI 는 실제로 표준 AI 보다 더 나쁜 성적을 거두었습니다. 너무 뻔했기 때문에 쉽게 걸렸습니다.
  • D-BOS 방법: 이 AI 는 가장 좋은 성적을 거두었으며, 특히 사회적 추리 게임 (아발론) 에서 두드러졌습니다. AI 는 적에게는 자신의 정체성을 숨기고 아군에게는 드러내는 균형을 배워 팀의 점수를 극대화했습니다.

5. 함정: "흐릿한 거울"

이 논문은 또한 한 가지 제한 사항을 인정합니다. 다른 사람들이 무엇을 생각하는지 예측하려면 AI 는 그들이 무엇을 보는지 추측해야 합니다.

  • 비유: 친구가 무엇을 생각하는지 추측하려 한다면, 그들이 무엇을 보고 있는지 추측해야 합니다. 당신의 추측이 약간 틀리고, 10 단계 앞을 계획하려 한다면 그 작은 오류가 증폭되어 계획이 무너집니다.
  • 결과: AI 는 몇 단계 앞 (예: 3 수) 을 계획할 때 가장 잘 작동합니다. 복잡하고 시각적인 게임에서 너무 먼 미래 (예: 5 수) 를 계획하려 하면 "흐릿한 거울"이 너무 왜곡되어 전략이 실패합니다.

요약

D-BOS는 AI 가 사회적 전략을 학습하는 새로운 방법입니다. "기만하라"는 명령을 맹목적으로 따르는 로봇이 아니라, **"내 행동이 당신에게 대한 당신의 신념을 바꾸고, 당신의 신념은 당신이 어떻게 플레이하는지를 바꾼다. 나는 당신을 승리하는 데 도움이 되는 방향으로 신념을 조종하기 위해 행동을 선택할 것이다"**라고 이해하는 전략적 사고자입니다.

이 연구는 숨겨진 역할이 있는 게임에서 승리하는 최선의 방법은 게임에 능숙한 것뿐만 아니라, 다른 플레이어들이 당신에 대해 스스로 만들어가는 이야기를 관리하는 것임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →