← 최신 논문
🧬 biology

Do Language Models Align with Brains? Prediction Scores Are Not Enough

엄격한 L-PACT 프레임워크를 사용하여 본 연구는 긍정적 예측 점수에도 불구하고 현재 언어 모델이 인간 뇌 표현과 진정으로 정렬되지 않으며, 그 겉보기 성공은 구조적 유사성이 아닌 통제 조건에 의해 완전히 설명된다는 것을 보여줍니다.

원저자: Xiao Jia

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiao Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

새롭고 매우 똑똑한 로봇 (즉, 언어 모델) 이 인간의 뇌처럼 생각하는지 알아내려 한다고 상상해 보세요.

수년 동안 과학자들은 다음과 같은 질문을 통해 이 문제에 답하려 했습니다: "우리가 로봇에 이야기를 입력하면, 다음에 인간의 뇌의 어떤 부분이 활성화될지 로봇이 맞출 수 있을까요?" 로봇이 자주 정확히 맞춘다면, 과학자들은 "아하! 이 로봇은 인간처럼 생각하는 게 틀림없다!"라고 말합니다.

**"언어 모델은 뇌와 정렬되는가? 예측 점수만으로는 부족하다"**라는 제목의 이 논문은 이러한 사고방식에 결함이 있다고 주장합니다. 저자 샤오 자 (Xiao Jia) 는 로봇이 좋은 추측을 할 수 있다고 해서 그것이 실제로 뇌의 내부 작동 원리를 이해한다는 뜻은 아니라고 말합니다. 로봇은 단순히 운 좋은 패턴에 기반해 추측할 뿐일 수 있습니다. 마치 일요일이 아니라 화요일이라는 이유만으로 비가 온다고 예측하는 기상 예보관처럼, 기상학을 이해하지 못한 채로 말입니다.

이를 입증하기 위해 저자는 L-PACT라는 엄격한 '시험'을 고안했습니다. L-PACT 를 단일 시험이 아니라, 로봇이 인간 뇌와 정렬되었음을 증명하기 위해 통과해야 하는 4 단계 보안 검문소로 생각하세요.

L-PACT 시험의 네 가지 문

인간이 고보안 클럽 (즉, '뇌 클럽') 에 들어오려 한다고 상상해 보세요. 로봇은 네 개의 문을 통과해야 합니다. 만약 하나라도 실패하면 퇴출당합니다.

  1. 1 번 문: "동전 던지기보다 낫다" 확인 (예측 적절성)

    • 시험: 로봇이 무용한 무작위 추측이나 '방해' 기준선 (예: 고장 난 라디오) 보다 뇌 활동을 더 잘 예측할 수 있는가?
    • ** 함정:** 로봇은 단순히 무작위 추측을 이겨내는 것뿐만 아니라, '엄격한 통제 (severe control)'도 이겨내야 합니다. 여기서 통제란 단어가 뒤섞이거나, 문장이 반대로 되거나, 계층이 뒤섞여 무작위로 교란된 로봇을 의미합니다. 실제 로봇이 이 교란된 버전을 이기지 못한다면, 그것은 실제 이해가 아니라 소음에 기반한 추측일 뿐입니다.
    • 결과: 이 연구에 포함된 로봇들은 실패했습니다. 그들은 교란된 버전들을 이기지 못했습니다.
  2. 2 번 문: "지도 확인" (관계적 적절성)

    • 시험: 정답을 맞히는 것만으로는 부족합니다. 로봇은 인간 뇌와 동일한 방식으로 지식을 조직화해야 합니다.
    • 유사성: 두 개의 지도를 상상해 보세요. 하나는 인간 뇌가 그린 도시 지도이고, 다른 하나는 로봇이 그린 지도입니다. 두 지도 모두 올바른 목적지로 데려다주더라도, 인간 지도에는 학교 옆에 공원이 있지만 로봇 지도에는 화산 옆에 공원이 있다면 두 지도는 다릅니다.
    • 함정: 로봇은 단순히 점수를 잘 맞는 것이 아니라, 인간 뇌의 지도와 일치하는 내부 '관계 지도'를 보여줘야 합니다.
    • 결과: 로봇들은 실패했습니다. 그들의 내부 지도는 인간 뇌의 지도와 다르게 조직화되어 있었습니다.
  3. 3 번 문: "수술 확인" (기제 박리)

    • 시험: 이는 '반사실적 (counterfactual)' 시험입니다. 로봇의 뇌 중 특정 부분 (예: 놀라움을 이해하거나 문법을 처리하는 능력) 을 수술적으로 제거했을 때, 그 로봇의 성능이 인간 뇌가 그 특정 작업을 수행할 때만 유일하게 떨어지는가?
    • 유사성: 자동차에서 엔진을 제거하면 차가 달리지 않아야 합니다. 로봇에서 '문법' 부분을 제거하면 문법 작업에서는 실패하지만 다른 작업에서는 여전히 괜찮아야 합니다. 만약 부분을 제거했을 때 모든 것이 균등하게 망가진다면, 로봇은 실제로 그 특정 작업을 위해 그 부분을 사용하지 않았다는 뜻입니다.
    • 결과: 로봇들은 실패했습니다. 부분을 제거했을 때의 피해가 특정하지 않아, 그들이 인간과 동일한 '기제'를 사용하고 있음을 증명할 수 없었습니다.
  4. 4 번 문: "천장 확인" (신뢰성 제한)

    • 시험: 로봇이 가능한 절대 한계에 얼마나 가까운가?
    • 유사성: 인간 뇌를 카메라라고 상상해 보세요. 최고의 카메라조차도 (입자나 소음으로 인해) 사진이 얼마나 선명해질 수 있는지에 한계가 있습니다. 로봇의 사진이 흐릿하다면, 로봇이 나빠서 그런 것일까요, 아니면 카메라 (뇌) 자체가 본질적으로 소음이 많아서 그런 것일까요? 로봇이 인간 신뢰성의 '천장'에 도달했는지 알아야 합니다.
    • 결과: 로봇들은 천장에 전혀 도달하지 못했습니다. 그들의 점수는 실제 정렬로 간주될 만큼 너무 낮았습니다.

"양성 대조군": 시험이 작동함을 증명

혹시 "아마도 시험이 고장 난 걸까? 너무 어려울까?"라고 물을 수 있습니다.

저자는 통과해야 할 것들로 시험을 테스트함으로써 시험이 작동함을 증명했습니다:

  • "뇌 vs 뇌" 시험: 그들은 같은 인간 뇌의 한 부분을 다른 부분과 비교했습니다. 이는 시험을 통과했습니다 (동일한 뇌이기 때문!).
  • "가짜 신호" 시험: 그들은 데이터에 완벽한 가짜 신호를 심었습니다. 시험은 이를 정확히 일치하는 것으로 식별했습니다.
  • "저수준" 시험: 시험이 '단어가 막 시작되었다'와 같은 간단한 것들을 감지할 수 있는지 확인했습니다. 가능했습니다.

이는 시험이 고장 난 것이 아니라, 단지 이 연구에 포함된 로봇들이 통과하지 못했다는 것을 증명합니다.

큰 결론

이 논문은 사람들이 팟캐스트를 듣거나 이야기를 읽는 등 여러 실제 실험 데이터를 분석하고 GPT-2 와 Qwen 과 같은 여러 인기 있는 언어 모델을 테스트했습니다.

판결:

  • 146 회 시도 중 0 회가 네 가지 문을 모두 통과했습니다.
  • 로봇이 잘하는 것처럼 보였던 모든 순간, 더 자세히 살펴보면 그것은 단지 '위양성 (false positive)'이었습니다. 그들은 약한 기준선을 이겼을 뿐, '엄격한 통제 (교란된 버전)' 앞에서는 실패했습니다.
  • 저자는 이러한 결과를 **"통제 설명 가능 (control-explained)"**이라고 부릅니다. 이는 겉보기 성공은 로봇이 실제로 뇌가 작동하는 방식을 시뮬레이션한 것이 아니라, 단어 빈도나 타이밍과 같은 단순하고 뇌와 유사하지 않은 패턴을 포착했기 때문이라는 사실로 완전히 설명될 수 있음을 의미합니다.

교훈

이 논문은 예측 점수만으로는 부족하다고 결론 내립니다. 컴퓨터 모델이 당신의 뇌가 다음에 무엇을 할지 맞출 수 있다고 해서, 그것이 당신처럼 생각하는 것은 아닙니다. 그것은 단지 매우 뛰어난 추측자일 뿐일 수 있습니다.

모델이 실제로 뇌와 '정렬'되었다고 주장하려면, 이 엄격한 4 단계 보안 검사를 통과해야 합니다. 이 특정 연구에서, 테스트된 특정 데이터와 모델을 사용하여 볼 때, 어떤 언어 모델도 통과하지 못했습니다. 겉보기 유사성은 단순한 통계적 트릭에 의해 만들어진 환상이었지, 깊은 구조적 정렬이 아니었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →