← 최신 논문
🧬 biology

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

본 논문은 최첨단 대형 추론 모델 (LRMs) 이 새로운 게임 학습 중 인간의 게임 플레이 행동과 뇌 활동을 예측하는 데 있어 기존 강화 학습 에이전트보다 현저히 뛰어난 성과를 보임으로써 복잡한 환경에서 인간의 학습과 의사결정을 모델링하는 데 있어 더 우수한 계산 모델임을 입증한다.

원저자: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

매우 다양한 학생들에게 완전히 새롭고 복잡한 보드게임을 가르친다고 상상해 보세요. 여기 세 가지 유형의 학생이 있습니다:

  1. "무차별 대입" 학습자 (심층 강화학습): 이 학생들은 가능한 모든 수를 시도하고 수천 번 실패한 뒤, 오직 반복을 통해 규칙을 서서히 암기합니다. 그들은 매번 올바르게 앉을 때마다 간식을 얻는 강아지가 트릭을 배우는 것과 같습니다.
  2. "논리 퍼즐" 해결사 (베이지안 에이전트): 이 학생은 인간과 같은 논리학자로, 가능한 모든 규칙을 적어내고 과학자처럼 이를 테스트한 뒤, 한 수를 두기 전에 게임이 어떻게 작동하는지에 대한 완벽한 이론을 구축합니다.
  3. "슈퍼 독서가" (대규모 추론 모델 또는 LRMs): 이들은 인간이 쓴 거의 모든 것을 읽어본 고급 AI 시스템입니다. 이 특정 게임을 해본 적은 없지만, 보드를 보고 소리 내어 생각하며 인간처럼 거의 즉시 규칙을 파악할 수 있습니다.

실험
연구자들은 다음과 같은 질문을 하고자 했습니다: 이 학생들 중 누가 실제 인간과 가장 유사하게 사고하고 학습하는가?

이를 찾기 위해 연구자들은 게임에서 누가 이겼는지만 지켜본 것이 아니라, 실제 인간들을 MRI 기계 (뇌의 사진을 찍는 거대한 카메라) 안에 넣고 비디오 게임을 하도록 했습니다. 목표는 어떤 AI 학생의 "사고 과정"이 인간 뇌 내부의 실제 전기 활동과 일치하는지 확인하는 것이었습니다.

게임: 미스터리 상자
사용된 게임들은 디지털 미스터리 상자 같았습니다. 플레이어들은 규칙을 알지 못했습니다. "빨간 사각형을 만지면 죽는다"거나 "갈색 상자를 밀면 문이 열린다"는 사실을 발견해야 했습니다. 이 게임들은 패턴을 파악하고, 추측을 하며, 추측이 틀렸을 때 이를 수정하는 능력을 요구했습니다.

결과: "슈퍼 독서가"의 승리

  1. 행동 (게임 플레이 방식):

    • 무차별 대입 학습자들은 형편없었습니다. 실력을 기르기 위해 게임을 수백만 번이나 해야 했습니다. 그들은 느리고 서툴렀습니다.
    • 논리 퍼즐 해결사는 나쁘지 않았지만 다소 경직되어 있었습니다.
    • 슈퍼 독서가 (LRMs) 가 스타였습니다. 그들은 인간처럼 몇 번의 시도 만에 규칙을 배웠습니다. MRI 기계 안에 있던 사람들과 같은 속도와 효율로 게임의 "미스터리"를 파악했습니다.
  2. 뇌 스캔 (사고의 "X 선"):

    • 이것이 가장 놀라운 부분입니다. 연구자들이 AI 의 내부 "사고" (디지털 뇌 활동) 를 인간 뇌 스캔과 비교했을 때, 슈퍼 독서가가 완벽한 일치를 보였습니다.
    • AI 의 "사고"는 사물을 보는 시각 피질과 계획을 세우는 전두피질에서 일어나는 인간 뇌의 활동과 거의 정확히 같았습니다.
    • 무차별 대입 학습자들은 어떨까요? 그들의 "사고"는 인간 뇌와 전혀 닮지 않았습니다. 계산기와 인간 마음을 비교하는 것과 같았습니다.
    • 슈퍼 독서가는 다른 AI 모델들보다 인간 뇌 활동을 10 배 더 잘 예측했습니다.

"사고"와 "수행"의 놀라운 차이
연구자들은 슈퍼 독서가들에 대해 이상한 점을 발견했습니다.

  • 발견: 규칙을 파악하는 동안에는 매우 인간과 유사했습니다.
  • 수행: once 규칙을 파악한 뒤에는 때때로 루프에 갇히곤 했습니다. 승리할 수 있는 경로를 찾으면, 더 짧은 경로가 존재함에도 불구하고 그 정확히 같은 경로를 반복해서 되풀이했습니다. 반면 인간은 규칙을 알자마자 더 짧고 효율적인 경로로 즉시 전환했습니다.
  • 교훈: AI 의 "뇌" (게임 상태를 어떻게 표현하는지) 는 매우 인간적이지만, 그 "근육 기억" (계획을 어떻게 수행하는지) 은 다소 로봇적입니다.

왜 이것이 중요한가?
이 논문은 이러한 "슈퍼 독서가"(대규모 추론 모델) 가 인간처럼 행동할 뿐만 아니라 실제로 인간처럼 사고하는 최초의 AI 시스템임을 시사합니다.

일반적으로 AI 모델은 체스 플레이와 같은 특정 작업을 위해 훈련됩니다. 그러나 이러한 모델들은 이미 훈련을 통해 습득한 지식을 활용하여 규칙을 읽고 화면을 보는 것만으로 게임을 배웠습니다. 이는 인간이 새로운 것을 배우는 방식과 정확히 일치합니다. 즉, 제로부터 시작하는 것이 아니라 기존 일반 지식을 활용해 새로운 상황을 즉시 이해하는 것입니다.

한 줄 요약
우리가 세상을 이해하는 방식처럼 AI 를 만들고자 한다면, 무차별 대입 학습자처럼 패턴을 암기하도록 가르치지 마십시오. 대신 방대한 지식 라이브러리를 제공하고 문제를 해결하기 위해 "소리 내어 생각"하게 하십시오. 이 논문은 이러한 접근 방식이 우리처럼 게임을 플레이할 뿐만 아니라, 실제로 우리와 같은 뇌 부위에서 "뇌"가 빛나는 AI 를 만들어낸다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →