← 최신 논문
🧬 biology

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

본 연구는 자연스러운 게임 플레이 중 행동 (LAMs) 과 추론 (VLMs) 을 위한 기초 모델의 미세 조정이 서로 다른 뇌 정렬 패턴을 초래함을 보여주는데, 여기서 LAM 은 전두 - 운동 영역에서 비대칭적이고 행동에 특화된 표현을 보이며 두 모델 모두 강화 학습 기준선보다 우수한 성능을 발휘하여 그 이득이 대뇌 처리 계층을 따라 증가함을 보여줍니다.

원저자: Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

거인 MRI 기계 안에서 팩맨이나 스페이스 인베이더 같은 고전 아케이드 비디오 게임을 하는 사람들의 모습을 상상해 보세요. 이 기계는 초고감도 카메라처럼 작동하여 몇 초마다 그들의 뇌 사진을 찍고, 그들이 화면을 보고, 다음 행동을 고민하며, 버튼을 누를 때 어떤 부분이 활성화되는지 보여줍니다.

이 논문의 목표는 현대 AI 컴퓨터가 게임을 "생각"하는 방식이 인간의 뇌가 게임을 생각하는 방식과 유사한지 확인하는 것입니다.

다음은 이 연구를 간단한 비유로 풀어낸 내용입니다:

1. 플레이어: 세 가지 유형의 "마음"

연구자들은 게임을 이해하려는 세 가지 다른 유형의 "마음"을 비교했습니다:

  • 오래된 로봇 (RL Baselines): 이들은 오직 시행착오를 통해 이기도록 훈련된 전통적인 AI 에이전트들입니다. 간식을 위해 레버를 누르는 법을 배우는 개와 같습니다. 그들은 무엇을 해야 하는지는 알지만, 게임 세계나 규칙을 진정으로 "이해"하지는 못합니다.
  • 일반 관찰자 (VLMs): 이들은 인터넷을 읽고 수백만 개의 동영상을 시청한 현대 AI 모델 (시각 - 언어 모델) 입니다. 게임을 설명하고, 규칙을 설명하며, 그래픽에 대해 이야기할 수 있는 매우 똑똑한 관광객과 같습니다. 하지만 반드시 완벽하게 플레이하도록 훈련된 것은 아닙니다.
  • 행동 전문가 (LAMs): 이들은 일반 관찰자와 유사하지만, 컴퓨터 제어 및 게임 플레이 방법에 대한 방대한 양의 데이터로 특별히 "파인튜닝"되거나 훈련되었습니다. 조작이 본능이 될 때까지 연습한 프로 게이머와 같습니다.

2. 실험: "프롬프트" 트릭

연구자들은 AI 가 화면만 보게 두지 않았습니다. 그들의 사고 방식이 어떻게 변하는지 보기 위해 구체적인 지시사항, 즉 "프롬프트"를 주었습니다:

  • "행동" 프롬프트: "다음 수는 무엇이며, 왜 그렇게 합니까?" (수행에 초점).
  • "추론" 프롬프트: "게임에서 무슨 일이 일어나고 있으며, 목표와 위협은 무엇입니까?" (이해에 초점).

그런 다음 AI 의 내부 "생각" (디지털 표현) 과 인간 뇌 스캔을 비교하여 어떤 AI 가 인간의 뇌와 더 잘 일치하는지 확인했습니다.

3. 주요 발견

발견 A: 새로운 AI 는 인간과 훨씬 더 가깝습니다
"오래된 로봇"들은 나쁘지 않았지만, 현대 AI 모델 (일반 관찰자와 행동 전문가 모두) 은 인간 뇌 활동을 일치시키는 데 훨씬 더 뛰어났습니다.

  • 비유: 인간의 생각을 추측해 보려고 한다고 상상해 보세요. 오래된 로봇은 단순한 패턴을 기반으로 추측합니다. 새로운 AI 는 이야기, 사물, 목표에 대한 풍부한 이해를 기반으로 추측합니다. 새로운 AI 의 "추측"은 인간의 실제 뇌 활동과 훨씬 더 밀접하게 일치합니다.

발견 B: "사고" 향상은 뇌의 "계획" 부분에서 일어납니다
연구자들이 "행동" 또는 "추론" 프롬프트를 사용했을 때, AI 와 인간 뇌의 일치도가 더욱 향상되었습니다. 하지만 이 개선은 모든 곳에서 균등하게 일어나지 않았습니다.

  • 비유: 뇌를 도시라고 생각해 보세요. "초기 시각 피질"은 사람들이 게임을 처음 보는 정문입니다. "전두 - 두정" 영역은 계획과 의사 결정이 이루어지는 시청입니다.
  • 프롬프트는 AI 가 인간 뇌와 일치하는 정도를 "시각" 영역 (정문) 에 비해 "시청" (계획/의사 결정 영역) 에서 두 배 더 높였습니다. 이는 인간이 게임을 할 때 단순히 픽셀을 보는 것이 아니라 계획과 추론에 깊이 관여하며, AI 모델이 이에 대해 생각하도록 요청받을 때 이를 가장 잘 포착한다는 것을 시사합니다.

**발견 C: "대칭성" 대 "비대칭성" 놀라움
이것이 가장 흥미로운 발견입니다. 일반 관찰자 (VLM) 와 행동 전문가 (LAM) 가 전체적으로 뇌 활동을 예측하는 데 동등하게 뛰어났음에도 불구하고, 그들은 매우 다른 방식으로 이를 수행했습니다.

  • 일반 관찰자 (VLM) 는 균형 잡혀 있습니다: "추론"을 하거나 "행동"을 하도록 요청받으면, 뇌의 힘을 두 가지에 대략 균등하게 사용합니다. 병따개와 줄 자르기에 동등하게 뛰어난 스위스 아미 나이프와 같습니다.
  • 행동 전문가 (LAM) 는 편향되어 있습니다: 행동 전문가에게 "추론"을 하도록 요청하면, 실제로 새로운 가치를 더하는 데 어려움을 겪습니다. "행동"을 하도록 훈련된 것이 이미 너무 많은 정보를 흡수했기 때문에 별도로 "추론"을 요청하는 것은 중복되는 것으로 보입니다.
  • 비유: 행동 전문가를 전체 레시피 책을 외운 요리사로 상상해 보세요. "어떤 재료가 필요합니까?" (추론) 라고 물으면, 그들은 요리 (행동) 에 대해 이미 알고 있는 것을 반복할 뿐입니다. 그들의 뇌에서 "추론" 부분이 중복되는 이유는 "행동" 훈련이 이미 이를 모두 포함하고 있기 때문입니다. 인간 뇌에서는 이것이 행동 전문가의 "추론" 신호가 실제로 뇌의 계획 영역에서 예측을 방해하는 것으로 나타났습니다.

발견 D: "사고" 흔적은 더 약합니다
연구자들은 또한 "생각을 소리 내어 말하며" (답변 전에 사고의 사슬을 생성) 답변하는 새로운 유형의 AI 도 살펴보았습니다. 놀랍게도, "생각" 텍스트를 생성한 AI 부분은 단순히 최종 답변을 제공한 부분보다 인간 뇌와 유사했습니다.

  • 비유: 누군가가 퍼즐을 푸는 모습을 보는 것과 같습니다. 그들이 내리는 최종 수순은 인간이 손을 움직이는 방식과 일치합니다. 하지만 퍼즐을 풀면서 하는 내면의 독백 ("흠, 아마 이것을 시도해 봐야겠는데...") 은 최종 결정만큼 인간 뇌의 활동과 잘 일치하지는 않습니다.

요약

이 논문은 현대 AI 모델이 게임 중 인간이 생각하고 계획하는 방식을 시뮬레이션하는 데 훨씬 더 나아지고 있음을 보여줍니다. 그러나 단순히 AI 를 수행 (Action) 하는 데 더 좋게 만드는 것은 내부 구조를 특정 방식으로 변화시킵니다: "추론"과 "행동"이 너무 많이 겹쳐서 뇌의 계획 중심에서 구별할 수 없게 만듭니다. 이는 AI 와 인간이 동일한 "점수" (예측 정확도) 에 도달할 수는 있지만, 그들의 내부 "뇌"가 조직되는 방식은 근본적으로 다를 수 있음을 과학자들이 이해하는 데 도움이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →