← 최신 논문
🤖 machine learning

GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning

본 논문은 불완전 정보 자기 대국에서 표준 일반화 이점 추정(GAE)에 내재된 높은 분산을 극복하기 위해 QQ-부스팅 분산 감소 이점 추정기를 활용하는 새로운 알고리즘인 분산 감소 정책 최적화(VRPO)를 소개하며, 이를 통해 두더지주와 헤즈업 노리미트 텍사스 홀덤과 같은 경쟁적 다중 에이전트 게임에서 우수한 성능을 달성합니다.

원저자: Zhiyuan Fan, Gabriele Farina

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhiyuan Fan, Gabriele Farina

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러분은 포커나 중국에서 인기 있는 카드 게임인 '두지두'와 같은 복잡한 카드 게임을 하는 로봇 그룹을 가르치고 있다고 상상해 보세요. 문제는 무엇일까요? 로봇들은 서로의 카드를 볼 수 없으며, 속임수를 쓰려는 상대와 대결해야 합니다. 이기기 위해서는 로봇들이 상대가 이용할 수 없는 균형 잡히고 예측 불가능한 전략을 배워야 합니다. 이를 '균형'을 찾는 것이라고 합니다.

오랫동안 이러한 로봇들을 가르치는 가장 좋은 방법은 **자기 대결(Self-Play)**이었습니다. 로봇들이 수백만 번 자신들의 복사본과 대결하도록 두는 방식입니다. 이를 위한 가장 인기 있는 교사는 PPO(Proximal Policy Optimization)라는 알고리즘입니다.

그러나 이 논문의 저자들은 비밀 카드 게임에서 PPO 가 로봇을 가르치는 방식에 숨겨진 '결함'을 발견했습니다. 여기서는 간단한 비유를 통해 문제와 그들의 해결책을 설명합니다.

문제: 붐비는 방 속의 '잡음이 섞인 속삭임'

기존 PPO 에서 로봇은 과거에 취한 경로를 돌아보며 "그건 좋은 수였을까?"라고 묻습니다. 이에 답하기 위해 GAE(Generalized Advantage Estimation)라는 도구를 사용합니다.

GAE 를 게임 리플레이를 바탕으로 선수에게 조언을 속삭이는 코치라고 생각해 보세요.

  • 단순한 게임(체스 등) 에서: 미래는 예측 가능합니다. 코치가 "여기 폰을 움직였더니 승리했다"고 말하면, 선수는 그 이유를 정확히 알 수 있습니다.
  • 비밀 카드 게임(포커 등) 에서: 미래는 무작위성으로 가득 차 있습니다. 로봇이 다음에 다른 로봇들이 무엇을 할지 추측해야 하기 때문에 코치의 속삭임이 왜곡됩니다. 로봇들이 상대를 혼란스럽게 하려고 무작위적으로 플레이하기 때문에, 코치의 조언은 '잡음이 섞인 속삭임'이 됩니다.

비유: 모든 사람이 무작위 방향으로 빙글빙글 도는 방에서 춤 동작을 배우려고 한다고 상상해 보세요.

  • 옛 방법(GAE): 코치는 "왼쪽으로 발을 내디디면 안전할 거야"라고 말하려 합니다. 하지만 다른 사람들이 미친 듯이 빙글빙글 돌기 때문에 코치의 목소리는 혼란 속에 묻힙니다. 로봇은 "왼쪽으로 발을 내디뎌라... 아마? 아니면 오른쪽일까? 알기 어렵다!"라고 듣습니다. 이 '잡음'으로 인해 로봇의 학습은 불안정하고 느려집니다.
  • 논문의 발견: 코치가 완벽하다 하더라도 (게임에 대한 완벽한 지식을 가지고 있더라도), 그 잡음은 다른 춤추는 사람들이 무작위로 빙글빙글 돌기 때문에 발생합니다. 로봇은 나쁜 수와 다른 플레이어들의 무작위성으로 인한 단순한 불운을 구별할 수 없습니다.

해결책: "Q-Boosting"(수정구)

저자들은 이 잡음을 해결하기 위해 Q-Boosting이라는 새로운 도구를 고안했습니다.

코치가 단 하나의 무작위 리플레이를 바탕으로 다음을 추측하는 대신, Q-Boosting 은 코치가 동시에 모든 가능한 미래를 보고 평균을 내도록 요구합니다.

  • 비유: 코치가 "네가 왼쪽으로 발을 내디뎠을 때, 그 한 번 누군가가 네게 부딪혔다"라고 말하는 대신, 새로운 코치는 "네가 왼쪽으로 발을 내디뎠을 때, 50% 는 안전하고, 30% 는 막히며, 20% 는 넘어질 것이라고 계산했다. 평균적으로 왼쪽으로 발을 내디디는 것이 좋은 생각이다"라고 말합니다.

조언을 주기 전에 무작위성을 수학적으로 평균화함으로써 코치는 '잡음'을 제거합니다. 로봇은 "이 수는 평균적으로 좋다"는 명확하고 차분한 신호를 받으며, "이 특정 시간에는 좋았지만 그 때는 나빴을지도 모른다"는 식의 신호는 받지 못합니다.

이 새로운 교수법을 VRPO(Variance-Reduced Policy Optimization)라고 부릅니다.

결과: 더 똑똑한 로봇, 더 빠른 승리

이 논문은 이 새로운 방법 (VRPO) 을 기존 표준 (PPO) 과 여러 게임에서 비교 테스트했습니다.

  1. 작은 게임(실험실): "거짓말 주사위"와 "유령 틱택토"와 같은 게임을 플레이했습니다. 이러한 게임에서는 로봇의 성능을 수학적으로 증명할 수 있었습니다.

    • 결과: VRPO 는 PPO 보다 훨씬 강력한 전략을 학습했습니다. 속이기 어려웠으며, 이는 완벽한 '균형' 전략에 더 가까웠음을 의미합니다.
  2. 중간 게임(경기장): 복잡한 3 인 카드 게임인 두지두를 플레이했습니다.

    • 결과: VRPO 는 동일한 컴퓨팅 파워를 사용함에도 불구하고 이전 최고의 AI(PerfectDou) 를 일대일 대결에서 꺾었습니다. 더 자주 이기는 법을 배웠습니다.
  3. 큰 게임(챔피언십): 고액 베팅 포커 변형인 헤즈업 노리미트 텍사스 홀덤을 시도했습니다.

    • 결과: VRPO 는 Slumbot 이라는 강력한 포커 봇과 매우 잘 경쟁했습니다. 미래 카드를 미리 보거나 게임 도중 복잡한 계산을 하는 등의 '치트' 없이도 긴 세션 동안 돈을 벌 수 있었습니다. 단순히 훈련을 통해 더 나은 전략을 배운 것입니다.

요약

이 논문은 로봇에게 비밀 카드 게임을 가르칠 때, 기존 학습 방법 (GAE) 은 다른 플레이어들의 무작위성 때문에 혼란을 겪는다고 주장합니다. 새로운 방법 (Q-Boosting 을 포함한 VRPO) 은 모든 가능성을 평균화한 후 조언을 하는 초지능 코치처럼 작동합니다. 이로 인해 혼란이 제거되어 로봇들이 더 빠르게 학습하고, 더 안정적으로 플레이하며, 훨씬 더 이기기 어려워집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →