Impartial Games: A Challenge for Reinforcement Learning
이 논문은 AlphaZero 방식의 강화 학습 알고리즘이 추상적인 수학적 원리를 학습하는 데 있어 근본적인 표현의 병목 현상으로 인해 님(Nim)과 같은 공정 게임에서 전문가 수준의 숙련도에 도달하는 데 실패함을 입증하며, 단순한 하이퍼파라미터 튜닝으로는 암기된 상태를 넘어 일반화하지 못하는 한계를 극복할 수 없음을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서, 특정 유형의 컴퓨터 프로그램은 최근 복잡한 전략 게임을 정복하는 능력으로 유명해졌습니다. 자신과 수백만 번의 게임을 치름으로써, 이 프로그램들은 심지어 위대한 인간 전문가들조차 놀라게 만드는 수를 두는 법을 배웁니다. 이들은 체스나 바둑처럼 패턴을 인식하고, 형세를 평가하며, 여러 단계 앞을 내다보는 계획을 세우는 데 성공 여부가 달린 게임에서 챔피언이 되었습니다. 그 근저에 깔린 아이디어는 만약 기계가 게임의 흐름을 이해함으로써 승리하는 법을 배울 수 있다면, 결국 어떤 복잡한 문제라도 해결할 수 있을 것이라는 점입니다. 그러나 이러한 성공은 잘못된 안도감을 만들어냈습니다. 이 기계들이 학습하는 방식이 보편적이지 않다는 사실이 밝혀졌기 때문입니다. 규칙은 단순하고, 기물은 양쪽 플레이어가 공유하며, 승리 전략이 패턴 인식이 아닌 숨겨진 수학적 논리에 의존하는 특정 부류의 게임들이 존재합니다. 이러한 게임에서 가장 진보된 인공지능 시스템들은 벽에 부딪히며, 인간에게는 해결 가능한 원리들을 학습하는 데 실패합니다.
임페리얼 칼리지 런던과 퀸 메리 런던 대학교의 연구진은 '님(Nim)'이라는 게임을 사용하여 이 사각지대를 조사하기로 했습니다. 님은 여러 개의 물체 더미로 구성된 게임으로, 두 명의 플레이어가 차례대로 한 더미에서 원하는 만큼의 물체를 가져가는 방식입니다. 목표는 마지막 물체를 가져가는 사람이 되는 것입니다. 이 게임은 겉보기에는 단순해 보이지만, 승리의 비결은 더미 크기의 이진수와 관련된 특정한 수학적 계산에 있습니다. 인간에게 이 규칙을 배우는 것은 단 하나의 추상적인 개념을 이해하는 문제입니다. 하지만 인공지능에게 도전 과제는 다릅니다. 연구진은 체스를 정복했던 것과 동일한 학습 알고리즘이 님에서도 승리하는 법을 배울 수 있는지, 만약 그렇지 않다면 그 이유가 무엇인지 알고 싶었습니다. 그들은 유명한 알파제로(AlphaZero) 학습 시스템의 커스텀 버전을 구축했고, 이를 점점 커지는 크기의 님 보드에서 플레이하도록 훈련시키며 컴퓨터의 이해도가 어떻게 진화하는지 면밀히 관찰했습니다.
결과는 극명하고 시사하는 바가 컸습니다. 연구진이 다섯 개의 더 더미가 있는 작은 님 보드에서 시스템을 테스트했을 때, 컴퓨터는 잘 플레이하는 법을 배웠습니다. 컴퓨터는 일관되게 승리할 수 있었으며, 게임을 시작하고 승리로 이끄는 방법을 아는 챔피언처럼 행동했습니다. 그러나 보드 크기가 여섯 개 또는 일곱 개의 더미로 늘어나자마자, 시스템의 성능은 무너졌습니다. 컴퓨터는 승리하는 법을 배우는 것을 멈췄습니다. 올바른 수를 찾는 대신, 컴퓨터는 무작위로 수를 선택했을 때와 다를 바 없이 추측하기 시작했습니다. 연구진은 문제가 게임이 너무 복잡하거나 컴퓨터에 훈련 시간이 더 필요해서가 아님을 발견했습니다. 문제는 컴퓨터의 뇌, 즉 신경망이 정보를 처리하는 방식의 근본적인 부분에 있었습니다. 이러한 네트워크는 특정 기물의 배치가 보통 승리로 이어진다는 것을 인식하는 것처럼 사물 사이의 연결 고리를 포착하는 데는 탁-월합니다. 하지만 이들은 '패리티(parity)'라고 불리는 특정한 유형의 논리, 즉 집단 내 숫자가 홀수인지 짝수인지를 세는 방식의 논리와는 매우 힘겹게 씨름합니다. 님에서는 승리하는 수가 전적으로 이러한 종류의 계산 논리에 달려 있습니다.
이것이 왜 중요한지 이해하기 위해, 연구진은 인공지능의 숙련도를 측정하는 새로운 방법을 도입했습니다. 그들은 '챔피언'과 '전문가'를 구분했습니다. 챔피언은 자신이 무엇을 해야 할지 아는 익숙한 영역으로 게임을 유도하여 시작 위치에서 승리할 수 있는 플레이어입니다. 반면 전문가는 보드의 어떤 위치에서도, 심지로 한 번도 본 적 없는 위치에서도 완벽한 수를 둘 수 있는 사람입니다. 연구는 인공지한 지능이 작은 보드에서는 시작 수를 암기하여 챔피언이 될 수 있음을 보여주었습니다. 그러나 전문가는 되지 못했습니다. 게임이 중반이나 종반 단계로 넘어가거나 보드가 더 커지면, 컴퓨터는 올바른 수를 찾아내지 못했습니다. 좋은 수를 알려주어야 할 내부 가이드가 혼란에 빠진 것입니다. 컴퓨터는 패배하는 수에 높은 확률을 부여하고 승리하는 수는 무시했습니다. 심지어 컴퓨터가 자신의 선택을 확인하기 위해 수백만 번의 시뮬레이션을 실행하더라도, 초기 추측이 너무 크게 빗나갔기 때문에 실수를 바로잡을 수 없었습니다.
연구진은 이러한 실패가 학습 방법 자체 때문인지, 아니면 게임 논리의 난이도 때문인지를 테스트했습니다. 그들은 두 플레이어가 서로 다른 더미를 제어하며 승리를 위해 패리티 논리를 사용할 필요가 없는 변형된 게임을 만들었습니다. 이 수정된 게임에서 동일한 인공지능은 빠르게 그리고 쉽게 학습했으며, 이는 학습 시스템 자체가 능력이 있음을 증명했습니다. 이는 문제가 훈련 과정이 아니라, 원래 게임에 요구되는 특정한 유형의 수학에 있다는 것을 확인시켜 주었습니다. 컴퓨터는 자신이 스스로 플레이하며 생성한 데이터로부터 패리티라는 추상적인 규칙을 단순히 학습할 수 없었던 것입니다. 컴퓨터가 초기 학습 단계에서 저지른 실수로 인해 발생한 데이터의 노이즈가, 네트워크가 근저에 깔린 패턴을 파악하는 것을 불가능하게 만들었습니다.
이 발견은 충분한 데이터와 컴퓨팅 파워가 주어진다면 현재의 인공지능이 어떤 문제든 해결할 수 있다는 생각에 도전합니다. 이는 이러한 시스템이 스스로 학습할 수 없는 특정한 유형의 논리적 추론이 존재함을 시사합니다. 연구진은 님과 같은 게임, 혹은 추상적인 수학에 의존하는 다른 복잡한 문제들을 진정으로 마스터하기 위해서는 미래의 인공지능이 다르게 구축되어야 한다고 제안합니다. 그들은 현재 시스템의 패턴 매칭 능력과, 이러한 특정한 논리 규칙을 처리할 수 있는 별도의 상징적 추론 모듈을 결 조합할 것을 제안합니다. 그러한 변화가 이루어지기 전까지, 이 강력한 학습 시스템들은 어떤 분야에서는 챔피언이 되겠지만, 다른 분야의 근본적인 논리에는 눈이 먼 채로 남아, 인간이 단 하나의 통찰력으로 도달할 수 있는 진정한 전문성의 수준에 이르지 못할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.