DraftFM: A FoundationModel for Day-Zero Drafting in Magic: The Gathering
DraftFM은 공개된 속성과 드래프트 문맥만을 사용하여 미공개 카드의 점수를 매김으로써, 과거의 픽 데이터나 카드 정체성에 의존하지 않고도 전문가 수준의 성능을 달akh하여 매직 더 개더링의 데이 제로 드래프팅을 가능하게 하는 파운데이션 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
경쟁적인 카드 게임의 세계에는 새로운 카드 세트가 공개되는 순간, 하지만 아무도 그 카드로 실제로 게임을 해보기 전이라는 시점에 발생하는 독특한 도전 과제가 있습니다. 수백 장의 새로운 카드가 들어 있는 신선한 박스를 가지고 덱을 구성하기 위해 모인 플레이어들을 상상해 보십시오. 그들은 각 카드가 실제 게임에서 어떻게 성능을 발휘할지 전혀 모르는 상태에서, 어떤 카드를 가져가고 어떤 카드를 다음 플레이어에게 넘길지를 하나씩 결정해야 합니다. 이것이 바로 '데이 제로(day-zero)' 문제입니다. 수십 년 동안, 플레이어들의 이러한 선택을 돕기 위해 설계된 컴퓨터 프로그램들은 계속 기다리는 상태에 머물러 있었습니다. 이 프로그램들은 과거의 게임으로부터 학습하는 데 의존하지만, 새로운 세트가 도착하면 학습할 과거의 데이터가 존재하지 않습니다. 데이터가 아직 존재하지 않는 것입니다. 이로 인해 플레이어들은 전적으로 인간의 직관과 전문가의 의견에 의존하게 되는데, 이는 가치가 있지만 주관적이며 사람마다 다릅니다. 연구자들에게 던져진 질문은, 컴퓨터가 완전히 새로운 세트에 대해 단 한 번의 선택도 보지 않고도 스마트한 추측을 할 수 있을 만큼 좋은 카드 선택의 일반적인 규칙을 충분히 학습할 수 있는가 하는 것이었습니다.
브라이언 워드(Brian Ward)라는 연구자는 DraftFM이라는 새로운 시스템을 통해 이 문제에 도전했습니다. 이 시스템은 특정 카드를 암기하려고 하거나 데이터가 축적되기를 기다리는 대신, 수년에 걸쳐 29개의 서로 다른 카드 세트에서 인간 플레이어들이 내린 거의 1 억 5천만 개의 선택을 학습했습니다. 핵심 혁신은 컴퓨터가 카드를 바라보는 방식에 있습니다. 시스템은 각 카드를 암기해야 할 고유한 이름으로 취급하는 대신, 모든 카드를 색상, 비용, 유형, 그리고 규칙의 텍스트와 같은 물리적 및 서술적 특성의 목록으로 분해합니다. 또한, 카드의 설명을 읽기 위해 고정된 사전 학습된 언어 이해 능력을 사용합니다. 다양한 세트를 통해 학습함으로써, 이 시스템은 이러한 특징들만을 바탕으로 무엇이 카드를 가치 있게 만드는지에 대한 패턴을 인식하는 법을 배웠습니다. 이 시스템은 카드의 이름이나 그것이 어느 세트에 속하는지는 알지 못합니다. 오직 자신이 볼 수 있는 특징들만을 알 뿐입니다. 이를 통해 시스템은 몇 년 전 공부했던 카드들에 사용했던 것과 동일한 논리를 바탕으로, 한 번도 접해보지 못한 새로운 카드를 보고 점수를 매길 수 있습니다.
이러한 접근 방식이 실제로 작동하는지 테스트하기 위해, 연구자는 훈련 데이터에서 세 개의 전체 카드 세트를 제외했습니다. 이 세트들은 모델에게 완전히 알려지지 않은 것들이었습니다. 시스템이 이 새로운 세트들에서 인간 플레이어들이 무엇을 선택할지 예측하도록 요청받았을 때, 시스템은 놀라운 정확도로 수행되었습니다. 플레이어가 수십 가지의 선택지를 가지고 있어 무작ful한 운으로 정답을 맞힐 확률이 약 7%에 불과한 드래프트의 첫 번째 선택에서, 모델은 인간의 선택과 약 51~60%의 확률로 일치했습니다. 이는 이전의 컴퓨터 모델들이 세트가 출시되고 몇 주가 지나기 전까지는 아예 시도조차 할 수 없었던 작업을 고려할 때 상당한 도약입니다. 또한 시스템은 인간 플레이어들이 선택할 수 있는 카드의 폭이 가장 넓은 드래프트의 아주 초반부에 가장 일관된 경향을 보이며, 가용한 카드의 풀이 줄어듦에 따라 선택이 더 예측 가능해진다는 점을 정확히 식별해 냈습니다.
이 시스템의 진정한 시험대는 호빗을 기반으로 한 새로운 세트의 출시였습니다. 대부분의 사람들이 드래프트를 진행하는 디지털 플랫폼에 해당 세트가 공개되기도 전에, 연구자는 DraftFM을 사용하여 해당 세트의 모든 카드에 대한 완전한 순위를 생성했습니다. 이 순위는 디지털 타임스탬프와 함께 생성되어 세트가 라이브로 공개되기 약 36시간 전에 게시되었으며, 이는 카드가 실제로 어떻게 작동하는지에 대한 지식 없이 예측이 이루어졌음을 보장합니다. 연구자는 이후 컴퓨터가 생성한 순위를 카드 커뮤니티에서 잘 알려진 6명의 독립적인 인간 전문가들의 사전 출시 리뷰와 비교했습니다. 결과는 컴퓨터의 순위가 인간 전문가들이 서로의 의견에 동의하는 정도만큼 인간 전문가들과 일치함을 보여주었습니다. 컴퓨터가 인간을 능가하지는 못했지만, 단 한 번의 게임도 플레이하거나 단 하나의 드래프트 로그도 보지 않고도 인간의 합의 수준에 도달했습니다.
이 연구는 컴퓨터가 완전히 새로운 콘텐츠에 대해 정보가 담긴 예측을 할 수 있을 만큼 복잡한 게임의 기저에 깔린 논리를 학습할 수 있음을 입증합니다. 이는 과거의 경험으로부터 미래의 미지(unknowns)로 일반화하는 능력이 카드 드래프트처럼 복잡한 영역에서도 가능하다는 것을 증명합니다. 시스템이 완벽한 것은 아닙니다. 예측에 있어 일률적으로 과도하게 자신만만하며, 선택이 어려울 때 인간 전문가의 미묘한 차이를 따라잡는 데 여전히 어려움을 겪습니다. 그러나 이 시스템은 '데이 제로'에 무엇이 가능한지에 대한 새로운 기준을 세웠습니다. 카드를 암기된 이름이 아닌 특징들의 집합으로 취급함으로써, 모델은 역사를 배우는 것과 미지의 영역을 항해하는 것 사이의 간극을 메웁니다. 연구자는 새로운 세트의 실제 드래프트 데이터가 확보되는 대로 후속 연구를 발표하겠다고 약속했으며, 이는 모델의 예측이 실제 카드가 어떻게 플레이되는지에 대한 현실과 부합하는지를 밝혀낼 것입니다. 그때까지, 이 연구는 기계가 규칙이 처음 작성되는 순간에도 예측의 게임을 학습할 수 있다는 것을 보여주는 증거로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.