← 최신 논문
💬 NLP

Large Language Models as Proxies for Theories of Human Linguistic Cognition

이 논문은 현재의 거대 언어 모델들이 언어적 패턴 습득을 평가하기 위한 언어 중립적 인간 인지 이론의 대리물로서 활용될 수 있는 잠재력을 탐구하는 한편, 이러한 역할에서의 유용성이 현재로서는 상당히 제한적이라는 점을 인정한다.

원저자: Imry Ziv, Nur Lan, Emmanuel Chemla, Roni Katzir

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Imry Ziv, Nur Lan, Emmanuel Chemla, Roni Katzir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 질문: AI 챗봇은 인간의 뇌를 이해하는 미래가 될 수 있을까?

언어학자들(인간이 언어를 어떻게 배우는지 연구하는 과학자들)이 하나의 미스터리를 풀기 위해 노력하고 있다고 상상해 보세요. "인간 아기는 왜 그렇게 복잡한 규칙들을 다 파악할 만큼 충분한 예시를 듣지 못하는데도, 완벽하게 말을 할 수 있는 것일까?"

수십 년 동안 주도적인 이론(이를 이론 A라고 부릅시다)은 다음과 같이 말해 왔습니다: "인간은 뇌 속에 특별하고 내장된 '언어 칩'을 가지고 태어난다. 이 칩은 특정 언어 규칙에 편향되어 있어서, 마치 한 방향으로만 끼워 맞춰지는 퍼즐 조각과 같다."

최근에 새로운 아이디어가 등장했습니다(이를 이론 B라고 부릅시다). 이 이론은 이렇게 제안합니다: "어쩌면 우리는 특별한 칩이 필요하지 않을지도 모른다. 만약 컴퓨터에 충분한 텍스트를 입력하기만 한다면(아기가 단어를 듣는 것처럼), 컴퓨터는 스스로 규칙을 찾아낼 것이다. 따라서 현재의 AI 챗봇(대규모 언어 모델 또는 LLM)이 실제로 인간이 언어를 배우는 방식에 대한 가장 좋은 설명이다."

이 논문의 저자들은 이렇게 말합니다: "잠깐만요. 그건 완전히 맞지 않습니다."

저자들은 **프록시 뷰(Proxy View, 대리 관점)**라고 불리는 중간 단계의 아이디어를 제안합니다. 그들은 AI 챗봇이 인간의 뇌를 완벽하게 모델링하는 것은 아니지만, 제3의 미지의 이론(이론 C)을 위한 "테스트용 더미(test dummy)" 또는 "대리인(proxy)" 역할을 할 수 있다고 제안합니다. 이론 C는 공정하고 중립적인(특별한 '언어 칩'이 없는) 학습 시스템이지만, 여전히 언어를 배울 수 있는 시스템을 의미합니다.

이 논문은 다음과 같은 질문을 던집니다: "현재의 AI 챗봇이 중립적인 학습 시스템(이론 C)이 실제로 작동할 수 있다는 것을 증명하는 좋은 '테스트용 더미' 역할을 할 수 있을까?"


두 가지 큰 테스트

AI가 좋은 "테스트용 더미" 역할을 할 수 있는지 확인하기 위해, 저자들은 두 가지 유형의 실험을 수행했습니다. 이것을 두 가지 다른 장애물 달리기로 생각하면 됩니다.

테스트 1: "아기 책" 챌린지 (제한된 데이터로부터의 학습)

비유: 로봇에게 단 10번의 체스 게임을 보여주며 체스를 가르치려고 한다고 상상해 보세요. 인간 아이는 비교적 적은 양의 말(약 10년 동안의 대화)로부터 복잡한 문법을 배웁니다.
실험: 저자들은 다양한 양의 텍스트로 AI 모델을 훈련시켰습니다:

  • 어떤 모델은 10개월 된 아기만큼의 텍스트를 보았습니다.
  • 어떤 모델은 8살 아이만큼의 텍스트를 보았습니다.
  • 어떤 모델은 인간이 들을 수 있는 양인 80만 년 치의 방대한 데이터를 보았습니다.

그들은 모델들에게 인간은 쉽게 해결하지만 AI는 어려워하는 까다로운 문법 퍼즐을 테스트했습니다. 예를 들면 다음과 같습니다:

  • "누구(Who)" 퍼즐: *"Which book did you say that Kim hated?"*와 같은 문장에서 누가 무엇을 했는지 파악하는 것.
  • "That" 퍼즐: 문장에서 "that"이라는 단어를 언제 생략해야 하는지 아는 것 (예: *"Who did you say loves Sue?"*는 괜찮지만, *"Who did you say that loves Sue?"*는 원어민에게 어색하게 들리는 경우).

결과:
AI 모델들은 처참하게 실패했습니다.

  • 아주 작은 모델들(아기 수준의 데이터)은 틀렸습니다.
  • 결정적으로, 거대한 모델들(80만 년 치의 데이터로 훈련된 모델)조차도 여전히 틀렸습니다. 그들은 종종 문장의 잘못된 버전을 선호했습니다.

이것이 의미하는 바: 만약 무한한 시간과 데이터를 가진 컴퓨터조차 이러한 규칙을 찾아내지 못한다면, "중립적인" 인간 학습 시스템(이론 C) 역시 이를 해낼 가능성은 낮습니다. AI는 이 이론을 위한 좋은 "테스트용 더미" 역할을 수행하는 데 실패했습니다.

테스트 2: "이상한 언어" 챌린지 (특이한 것을 배우기)

비유: 당신에게 언어를 배우는 로봇이 있다고 상상해 보세요. 당신은 이 로봇이 "정상적인" 언어(영어와 같은)를 "이상한" 언어(모든 문장이 거꾸로 된 언어와 같은)보다 자연스럽게 선호하는지 알고 싶습니다.
실험: 저자들은 실제 언어들(영어, 이탈리아어, 러시아어)을 가져와서 수학적 기법을 사용하여 "이상한" 버전으로 만들었습니다:

  • 부분 역순(Partial Reverse): 문장의 절반을 뒤집음.
  • 전체 역순(Full Reverse): 문장 전체를 뒤집음.
  • 토큰 점프(Token Hop): 로봇이 기호를 놓을 위치를 알기 위해 단어를 세도록 함.

저자들은 AI에게 물었습니다: "어떤 버전이 배우기 더 쉬운가? 정상적인 버전인가, 아니면 이상한 버전인가?"

결과:
AI는 "이상함"에 대해 신경 쓰지 않았습니다.

  • 때때로, AI는 정상적인 언어보다 이상하고 거꾸로 된 언어를 배우는 것이 더 쉽다고 판단했습니다.
  • 때로는, 정상적인 언어를 더 어렵게 느끼기도 했습니다.

이것을 의미하는 바: 만약 AI(우리의 "테스트용 더미")가 정상적인 언어만큼이나 "이상한" 언어도 쉽게 배울 수 있다면, 이는 중립적인 학습 시스템이 왜 인간이 오직 실제 언어만을 사용하고 결코 거꾸로 된 언어를 사용하지 않는지를 자연스럽게 설명해주지 못한다는 것을 시사합니다. AI는 "실제" 언어가 더 배우기 쉽다는 것을 보여주는 데 실패했습니다.


결론: "테스트용 더미"가 고장 났다

저자들은 프록시 뷰(AI를 중립적 학습 이론의 대리인으로 사용하는 것)가 현재 작동하지 않고 있다고 결론지었습니다.

  • LLM 이론 (AI = 인간의 뇌): 이것은 틀렸습니다. 왜냐하면 AI는 인간 특유의 특징(예: 문장이 문법적으로는 맞지만 흔치 않은 경우와, 그냥 틀린 경우의 차이를 아는 것)이 부족하기 때문입니다.
  • 프록시 뷰 (AI = 중립적 이론을 위한 테스트용 더미): 이 또한 현재 실패하고 있습니다. AI 모델은 인간이 쉽게 배우는 특정 규칙을 배우는 데 너무 서툴고, 인간이 절대 사용하지 않는 "이상한" 규칙을 배우는 데는 너무 능숙하기 때문에, 중립적인 학습 시스템이 작동한다는 것을 증명하는 데 도움을 줄 수 없습니다.

최종 요약:
저자들은 AI가 쓸모없다고 말하는 것이 아닙니다. 그들은 현재 AI가 인간의 뇌와 비교했을 때 너무 다르기 때문에 새로운 이론을 검증하기 위한 신뢰할 수 있는 "테스트용 더 dummy"로 사용될 수 없다고 말하는 것입니다.

그들은 본질적으로 다른 과학자들에게 이렇게 말하고 있습니다: "만약 당신이 인간이 특별한 '언어 칩' 없이도 언어를 배운다는 것을 증명하기 위해 AI를 사용하고 싶다면, 훨씬 더 나은 AI를 만들거나 훨씬 더 명확한 이론을 먼저 세워야 합니다. 지금의 챗봇들은 그 역할을 수행하기에 역부족입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →