← 최신 논문
💬 NLP

UniMaia: Steering Chess Policies with Language for Human-like Play

이 논문은 언어 프롬프트를 사용하여 고정된 Lc0 체스 정책 네트워크를 조정함으로써 게임 플레이 스타일과 강도에 대한 인간과 유사한 제어 가능성을 달성하면서도 도메인 특화 성능을 유지하고 엔드투엔드 멀티모달 학습을 요구하지 않는 파라미터 효율적 프레임워크인 UniMaia를 소개합니다.

원저자: Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터급 체스 코치가 있다고 상상해 보세요. 이 코치는 매우 똑똑하고 모든 가능한 수를 알고 있지만, 약간 로봇 같습니다. 그들은 항상 "완벽한" 게임을 플레이하여 승리하는 데는 훌륭하지만, 인간이 어떻게 플레이할지 보고 싶거나 특정 인물(예: 초보자나 그랜드마스터)처럼 플레이하게 하려면 지루할 수 있습니다.

반면, 창의적인 이야기꾼이 있습니다. 이 이야기꾼은 "초보자의 긴장감을 담아 플레이하라"거나 "시실리 방어전을 사용하라"는 지시를 따르며 대화하는 것을 좋아하지만, 체스 실력은 그다지 좋지 않아 종종 불법 수를 두거나 명백한 위협을 놓칩니다.

UniMaia는 두 세계의 장점을 모두 얻으려는 새로운 프레임워크입니다. 이는 "로봇 코치"(Lc0라는 고정된 사전 훈련된 체스 AI) 를 가져와 자연어 지시를 듣는 "번역기"(텍스트 인코더) 를 부여합니다.

다음은 몇 가지 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. 얼어붙은 코치와 새로운 번역기

체스 엔진 (Lc0) 을 완벽한 선수의 얼어붙은 동상이라고 생각하세요. 이 동상을 녹이거나 처음부터 다시 훈련시키는 것은 너무 많은 시간과 비용이 들고, 그 놀라운 체스 실력을 잃게 되므로 불가능합니다.

UniMaia 는 동상을 녹이지 않습니다. 대신 동상 주변에 **ControlNet 스타일의 "제어 패널"**을 구축합니다. 이는 동상에 일련의 다이얼과 레버를 부착하는 것과 같습니다.

  • 레버: 이는 텍스트 인코더(작은 언어 모델) 에 의해 제어됩니다.
  • 입력: "킹스 갬빗 오프닝을 사랑하는 1200 등급의 선수처럼 플레이하라"는 프롬프트를 입력합니다.
  • 작동: 텍스트 인코더가 당신의 말을 읽고 제어 패널의 다이얼을 돌립니다. 이 다이얼들은 동상의 뇌에 미세하고 정밀한 조정 (잔류 업데이트) 을 전달하여, 동상의 보드 이해라는 핵심 능력을 변경하지 않으면서도 더 인간처럼 플레이하거나 특정 전략을 따르도록 유도합니다.

2. "조향 장치" 비유

체스 엔진을 고성능 레이싱카라고 상상해 보세요. 이 엔진은 트랙에서 완벽하게 운전하는 법을 알고 있습니다.

  • 구식 방법: 이 차를 택시나 배송 트럭처럼 운전하게 하려면 엔진 전체를 처음부터 다시 재건해야 했습니다.
  • UniMaia 방식: 레이싱카 엔진은 그대로 유지합니다. 대신 음성 명령으로 프로그래밍할 수 있는 스마트 조향 장치를 설치할 뿐입니다. "신중한 택시 기사처럼 운전하라"고 말하면 조향 장치는 차의 경로를 약간 조정하여 더 보수적으로 만듭니다. "무모한 레이서처럼 운전하라"고 말하면 경로를 더 공격적으로 조정합니다. 엔진은 여전히 동일한 강력한 엔진이지만, 행동은 당신의 목소리에 따라 변합니다.

3. "인간 같은" 목표

연구자들은 AI 가 인간처럼 플레이할 수 있는지 확인하고자 했습니다. 인간은 실수를 하고, 선호하는 오프닝이 있으며, 실력 수준 (Elo 등급) 에 따라 다르게 플레이합니다.

  • 결과: UniMaia 는 체스 엔진을 "조종"하는 데 성공적으로 학습했습니다. 초보자처럼 플레이하라고 요청하면 실수를 더 많이 했습니다. 그랜드마스터처럼 플레이하라고 요청하면 더 정확하게 플레이했습니다. 텍스트 설명에 따라 다양한 체스 오프닝 사이를 전환하기도 했습니다.
  • 절충점: 약간의 균형이 필요합니다. AI 에게 "인간처럼 행동하라"거나 복잡한 지시를 따르도록 요청할수록, 순수한 안내 없는 체스 엔진에 비해 최상위 수 예측의 완벽함이 약간 떨어집니다. 하지만 인간 수 예측을 위해 특별히 구축된 모델들과는 여전히 매우 경쟁력 있습니다.

4. "타임머신" 기능 (UniMaia-Aux)

연구자들은 UniMaia-Aux라는 두 번째 버전을 추가했습니다. 이는 코치에게 타임머신스톱워치를 주는 것과 같습니다.

  • 텍스트 지시 외에도 이 버전은 수를 둔 시기, 플레이어의 시계에서 남은 시간, 그리고 이전 수를 생각하는 데 걸린 시간을 함께 살펴봅니다.
  • 결과: 이는 AI 가 인간 행동을 더 잘 이해하도록 도왔습니다. 예를 들어, 게임 상황과 시간 압박에 따라 인간이 언제 "기권"(포기) 할지 예측하는 능력이 표준 버전보다 훨씬 향상되었습니다.

5. 데이터 식단

이 시스템을 가르치기 위해 연구자들은 무작위 게임만 공급하지 않았습니다. Lichess 에서 52 억 개의 체스 게임으로 구성된 거대한 라이브러리를 구축했습니다.

  • "프랑스 방어전을 두는 1500 등급의 선수"와 같이 이 게임들에 대한 수백만 개의 다양한 지시를 자동으로 작성하는 "프롬프트 생성기"를 만들었습니다.
  • 이를 통해 인간이 모든 지시를 일일이 수동으로 작성할 필요 없이 시스템이 다양한 인간 플레이 스타일을 이해하도록 훈련시킬 수 있었습니다.

요약

UniMaia는 강력한 AI 가 지시를 따르게 하려면 처음부터 다시 구축할 필요가 없음을 증명합니다. 고정된 전문가에 경량의 "언어 번역기"를 부착함으로써 자연어로 그 행동을 조종할 수 있습니다. 이는 단순한 계산기가 아니라 다양한 인간 플레이어를 모방하고, 특정 전략을 따르며, 시계의 압박까지 이해할 수 있는 유연한 파트너가 되는 체스 AI 를 만들어냅니다. 물론 그 핵심 체스 천재성은 그대로 유지됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →