Only the Tens Count, but Trumps Decide: Formalising and Benchmarking Dahal Jeet, a Nepali Variant of Mendikot
이 논문은 이전에 기록되지 않았던 네팔의 카드 게임인 다할 지트(Dahal Jeet)를 공식적으로 정의하고, 탐색 기반 에이전트가 학습 기반 방법보다 우수한 성능을 보임을 입증하는 종합적인 계산 벤치마크를 제시하며, 승리의 더 강력한 예측 인자가 점수 카드보다 트럼프의 길이임을 밝히고 인간과 에이전트 간의 성능 차이를 정확하게 측정하기 위해서는 딜 변동성을 제어하는 것이 필수적임을 드러낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 연구자들은 종종 자신의 창조물을 서로 맞붙여 경쟁하게 함으로써 그들을 테스트하곤 합니다. 이러한 게임은 과학자들이 컴퓨터 프로그램이 얼마나 잘 학습하고, 계획하며, 불확실성에 적응하는지를 볼 수 있는 실험실 역할을 합니다. 체스와 같은 일부 게임은 모든 기물이 양측 모두에게 보이는 완벽한 정보(perfect information)를 바탕으로 진행됩니다. 반면 포커나 브리지와 같은 게임은 상대방의 패를 완전히 알지 못한 채 결정을 내려야 하는 불완전한 정보(imperfect information)의 게임입니다. 수십 년 동안 이러한 숨겨진 정보 게임을 정복하기 위한 표준적인 접근 방식은 강화 학습(reinforcement learning)이라고 알려진 시행착오를 통해 컴퓨터를 가르치는 것이었습니다. 수백만 번의 핸드를 플레이함으로써 인공 에이전트가 결국 인간의 직관을 뛰어넘는 전략을 발견할 것이라는 희망이었습니다. 그러나 학습이 항상 최선의 길이라는 이 가정은, 특정 상황에서는 '알려진 바를 바탕으로 앞을 내다보고 계획하는 것'과 같은 다른 종류의 사고방식이 더 효과적일 수 있는지를 묻는 새로운 연구 흐로 인해 도전을 받고 있습니다.
이 질문은 네팔의 테라이-마데시(Terai-Madhesh) 지역에서 매일 플레이되는 '다할 지트(Dahal Jeet)'라는 카드 게임에 대한 연구에서 핵심적인 주제가 됩니다. 이 게임은 네 명이 두 개의 고정된 파트너십을 이루어 플레이하는 '코트 피스(Court Piece)' 계열의 변형 게임입니다. 규칙은 단순하지만 독특한 전략적 지형을 만들어냅니다. 플레이어들은 각각 13장의 카드를 나누어 가지며, 트럼프 수트(trump suit)는 플레이어의 손패에서 무작위로 뽑힌 것에 의해 결정됩니다. 목표는 트릭을 따내는 것이지만, 점수는 매우 구체적인 방식으로 부여됩니다. 덱에 있는 단 4개의 텐(10) 카드만이 점수 계산에 포함됩니다. 한 팀이 3개 이상의 텐을 확보하면 그 핸드에서 승리합니다. 만약 텐이 양 팀에 각각 2개씩 균등하게 나뉘었다면, 승자는 더 많은 트릭을 확보한 쪽으로 결정됩니다. 이는 가장 중요한 카드가 매우 드물고 희귀하며, 결과가 꾸준한 점수 축적보다는 단 하나의 결정적인 타이브레이킹(tie-breaking) 조건에 의해 좌우되는 상황을 만듭니다.
이 연구가 시작되기 전까지, 이 게임은 그것이 플레이되는 마을들의 구전 전통 속에만 존재했습니다. 서면으로 된 규칙 책도, 디지털 버전도, 어떻게 작동하는지에 대한 과학적 분석도 없었습니다. 연구자들의 첫 번째 단계는 이 게임을 공식적으로 기록하는 것이었습니다. 그들은 7개 지역의 플레이어들을 관찰하며 실제 플레이되는 규칙을 기록하고, 정밀한 디지털 버전을 만드는 데 수년을 보냈습니다. 이를 통해 그들은 인간이 하는 것과 똑같이 게임을 수행할 수 있는 컴퓨터 엔진을 구축할 수 있었고, 이는 다양한 인공지능 전략을 테스트하기 위한 토대가 되었습니다.
연구진은 어떤 유형의 인공지능이 다할 지트를 가장 잘 플레이할 수 있는지 알아보기 위해 나섰습니다. 그들은 기본적인 규칙을 따르는 단순한 프로그램부터 시간이 지남에 따라 학습하여 개선되는 복잡한 시스템에 이르기까지 26개의 서로 다른 컴퓨터 에이전트를 구축했습니다. 또한 '결정론적 탐색(determinized search)'이라는 기술을 사용하는 에이전트들도 포함했습니다. 이 방법은 숨겨진 카드들의 가능한 여러 버전을 상상하고, 각 버전에 대해 최선의 수를 계획한 다음, 평균적으로 가장 잘 작동하는 수를 선택하는 방식으로 작동합니다. 연구팀은 수천 번의 매치를 통해 모든 에이전트를 서로 맞붙였으며, 결과가 단순히 운에 의한 것이 아님을 보장하기 위해 엄격한 통계적 방법을 사용했습니다.
결과는 놀라웠습니다. 가장 성공적인 에이전트는 시행착오를 통해 학습하는 모델이 아니었습니다. 대신, 최고의 성과를 낸 것은 탐색과 계획을 사용하는 모델들이었습니다. 특정 유형의 탐색 알고리즘을 사용하는 가장 강력한 에이전트는 학습 기반 시스템들을 훨씬 상회하는 레이팅을 달 achievement 했습니다. 실제로, 아무리 훈련을 시키거나 어떤 보상을 주더라도 학습 기반 에이전트 중 그 어떤 것도 정교하게 조정된 수기 규칙(hand-written rules)을 이기지 못했습니다. 이 연구는 이 특정 게임에서 앞을 내다보고 가능성을 계산하는 능력이 경험으로부터 배우는 능력보다 훨씬 더 강력하다는 것을 보여주었습니다.
가장 흥激로운 발견 중 하나는 컴퓨터가 게임을 어떻게 '보는지'에 관한 것이었습니다. 연구자들은 학습 에이전트에게 이미 플레이된 카드나 빠진 수트와 같은 더 많은 정보를 제공하는 것이 승리에 도움이 될 것이라고 예상했습니다. 그러나 오히려 에이전트들은 더 적은 정보를 받았을 때 더 잘 수행한다는 사실을 발견했습니다. 많은 세부 사항을 제거한 단순화된 게임 상태가 풍부하고 상세한 묘사보다 더 높은 승률을 이끌어냈습니다. 이는 이 특정 게임의 경우, 너무 많은 데이터가 학습 시스템을 혼란스럽게 할 수 있으며, 단순한 뷰가 핵심에 집중할 수 있게 해준다는 것을 시사합니다.
연구는 또한 게임의 결과가 실력 대 운 중 어느 쪽에 더 많이 기인하는지도 조사했습니다. 수천 번의 핸드를 분석한 결과, 플레이어가 받은 카드가 승패 차이의 거의 40%를 설명한다는 것을 발견했습니다. 이러한 높은 수준의 무작위성은 단순히 인간과 컴퓨터 사이의 승률을 비교하는 것이 오해를 불러일으킬 수 있음을 의미했습니다. 진정한 실력을 측정하기 위해 연구진은 새로운 방법을 개발했습니다. 그들은 인간 참가자가 플레이했던 정확한 핸드들을 가져와서, 인간의 자리에 컴퓨터 에이전트를 앉혀 재현했습니다. 이를 통해 운의 요소를 상쇄하고 동일한 카드에 대해 인간의 결정과 컴퓨터의 결정을 비교할 수 있었습니다.
이 쌍을 맞춘(paired) 방법을 사용했을 때, 결과는 바뀌었습니다. 컴퓨터의 전체 승률은 인간과의 대결에서 동전 던지기 수준이었지만, 쌍을 맞춘 분석은 컴퓨터가 인간의 카드로 플레이했다면 훨씬 더 많은 핸드를 이겼을 것임을 드러냈습니다. 인간은 컴퓨터가 동일한 딜(deal)에서 거두었을 승수보다 100번당 약 9번 더 많은 핸드를 졌습니다. 이는 컴퓨터가 실제로 더 뛰어나지만, 그 우위가 작아서 무작위적인 카드 분포에 의해 쉽게 가려질 수 있음을 증명했습니다.
연구는 점수를 결정하는 카드가 희귀하고 목표가 복잡한 게임에서는, 경험으로부터 배우는 것보다 앞을 내다보고 계획하는 것이 숙달에 이르는 더 신뢰할 수 있는 경로라고 결론짓습니다. 또한 이 연구는 운이 작용하는 게임에서 성공을 어떻게 측정할 것인가의 중요성을 강조합니다. 딜의 운을 통제하지 않는다면, 우리는 인간과 기계 사이의 진정한 실력 차이를 놓칠 수도 있습니다. 전통적인 게임을 기록하고 엄격한 과학적 테스트를 적용함으로써, 연구자들은 인공지능의 벤치마크를 생성했을 뿐만 아니라 문화 유산을 보존했으며, 심지어 즐거움을 위해 플레이되는 게임 속에서도 우리가 어떻게 생각하고 배우는지에 대한 깊은 교훈이 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.