The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network
이 연구는 릴라 체스 제로(Leela Chess Zero)에서 신경망의 내부 알고리즘적 탐색(look-ahead)이 체스 퍼즐을 정확하게 해결하지만, 이러한 해결책들이 학습된 안전 우선순위(safety priors)에 의해 최종 출력에서 체계적으로 무시된다는 점을 입증하며, 이는 알고리즘적 구조의 존재가 알고리즘적 행동을 보장하지는 않는다는 것을 증명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 뇌는 답을 알지만, 입은 다른 말을 한다
당신이 매우 어려운 수학 시험을 치르고 있다고 상상해 보세요. 당신은 수년간 공부한 천재입니다. 문제를 풀어나가면서 당신의 뇌는 정답인 42를 정확하게 계산해 냅니다. 당신은 100% 확신합니다. 계산도 마쳤고, 단계별 검증도 끝냈으며, 논리도 완벽합니다.
하지만 답을 적기 직전, 머릿속에서 어떤 목소리가 속삭입니다. "이봐, 42는 너무 위험해. 선생님이 화내시면 어떡해? 그냥 '10'이라고 적자. 그게 더 안전해. 아무도 다치지 않을 거야."
그래서 당신은 10이라고 적습니다.
이 논문은 **리라 체스 제로(Leela Chess Zero)**라는 초지능 AI 체스 엔진에 관한 이야기입니다. 연구진들은 이 AI가 정확히 똑같은 문제를 겪고 있다는 사실을 발견했습니다. 이 AI는 종종 자신의 "뇌"(중간 레이어) 깊은 곳에서는 완벽하고 승리할 수 있는 수를 계산해 내지만, 정작 그 답을 무시하고 지루하고 안전한 수를 두곤 합니다.
탐정 작업: "로짓 렌즈(Logit Lens)"
AI가 답을 알고 있었다는 것을 어떻게 알았을까요? 연구진은 **"로짓 렌즈"**라는 도구를 사용했습니다.
AI의 뇌를 15층짜리 건물이라고 생각해 보세요.
- 1층 (지면): AI가 체스판을 봅니다.
- 중간 층: AI가 생각하고, 계산하고, 다양한 수를 탐색하기 시작합니다.
- 최상층: AI가 최종 결정을 내리고 수를 선택합니다.
보통 우리는 최상층에서 일어나는 일만 볼 수 있습니다. 로짓 렌즈는 AI가 생각하는 동안 모든 층에서 작성되고 있는 메모를 엿볼 수 있게 해주는 특수한 안경과 같습니다.
이 안경을 통해 들여다보았을 때, 연구진은 충격적인 사실을 발견했습니다.
- 중간 층에서 AI는 자신만만하게 외치고 있었습니다: "여기에 퀸을 움직여! 체크메이트야! 우리가 이겼어!"
- 하지만 그 신호가 최상층으로 올라갈수록, 그 자신만만한 목소리는 점점 작아졌습니다.
- 최상층에 도달했을 때쯤, AI는 마음을 바꿔서 *"킹을 조금 뒤로 물러나게 하자"*와 같은 조용하고 안전한 수로 바꾸어 버렸습니다.
연구진은 이를 **"잊혀진 퍼즐(Forgotten Puzzles)"**이라고 부릅니다. AI는 해결책을 찾아냈지만, 그것을 사용하는 것을 "잊어버린" 것입니다.
왜 이런 일이 일어날까? "안전 보안요원(Safety Bouncer)"
연구진은 질문했습니다. AI가 수학 계산에 실패한 것일까? 아니가 체크메이트를 보지 못한 것일까?
그들은 "수학적 과정"(룩어헤드 메커니즘)을 확인했고, 그것이 완벽하게 작동하고 있음을 발견했습니다. AI는 미래의 수들을 실제로 보고 있었습니다. AI는 승리로 가는 경로를 알고 있었습니다.
그렇다면 무엇이 그것을 막았을까요?
그들은 AI가 **"안전 편향(Safety Bias)"**을 가지고 있다는 것을 발견했습니다.
AI의 학습 데이터를 수백만 개의 체스 게임이 담긴 거대한 도서관이라고 생각해 보세요. 그 게임들 중 대부분에서 기물을 잃지 않고 안전하게 플레이하는 것은 좋은 전략입니다. AI는 이 전략을 너무 잘 학습한 나머지 하나의 습관이 되어버렸습니다.
네트워크의 마지막 몇 개 레이어에서 **"안전 보안요원"**이 등장합니다. 이 보안요원은 흥미롭고 위험하며 승리할 수 있는 수(예를 들어, 게임에서 이기기 위해 퀸을 희생하는 것)를 보고 이렇게 말합니다. "안 돼, 안 돼, 안 돼. 그건 너무 위험해. 우리는 기물을 잃고 싶지 않아. 그냥 안전하게 가자."
보안요원이 천재적인 계산을 보수적인 본능으로 덮어버리는 것입니다.
증거: 보안요원을 밀쳐내기
이것이 문제였다는 것을 증명하기 위해, 연구진은 AI를 "조종(steer)"해 보았습니다. 마치 보안요원의 어깨에 손을 살짝 얹고 *"이봐, 긴장 풀어. 이번에는 위험을 감수해도 괜찮아"*라고 속삭이는 것과 같습니다.
연구진은 AI의 내부 생각을 '안전'에서 '공격성' 쪽으로 수학적으로 미세하게 조정함으로써 이 작업을 수행했습니다.
결과:
- 이렇게 하자, AI는 자신이 잊고 있었던 승리하는 수들을 갑자기 기억해 냈습니다.
- AI는 이전에 실패했던 퍼즐의 **61.7%**를 회복했습니다.
- 이는 AI가 처음부터 답을 가지고 있었으며, 단지 그 답을 말할 '허락'이 필요했을 뿐이라는 것을 증명했습니다.
시사점
이 논문의 핵심 교훈은 단순하지만 심오합니다: 컴퓨터가 머릿속에 정답을 가지고 있다고 해서, 반드시 그것을 입 밖으로 내뱉는 것은 아닙니다.
AI는 "멍청하거나" "고장 난" 것이 아닙니다. 오히려 매우 똑똑합니다. 하지만 AI의 "성격"(안전함을 추구하는 학습된 습관)이 때로는 "논리"(승리를 계산하는 능력)보다 더 강력할 수 있습니다.
이것은 중요한 의미를 갖습니다. 우리가 AI를 바라볼 때, 단지 최종 출력값만을 믿어서는 안 된다는 것을 보여주기 때문입니다. AI는 자신의 진정한 능력을 '주의(caution)'라는 층 뒤에 숨기고 있을지도 모릅니다. 만약 우리가 AI가 정말로 무엇을 할 수 있는지 알고 싶다면, AI가 무엇을 '하고 있는지'만이 아니라, 내부의 레이어를 들여다봄으로써 무엇을 '생각하고 있는지'를 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.