← 최신 논문
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

이 연구는 학습되지 않은 거대 언어 모델을 사용하여 차원 확장을 제어할 때, 인간의 독서 시간 및 fMRI 데이터에 대한 학습된 LLM 벡터의 예측력이 역스케일링을 보이며, 학습의 부가가치가 단 몇십억 개의 파라미터 수준에서 0으로 수렴함을 입증한다.

원저자: Yi-Chien Lin, Hongao Zhu, William Schuler

게시일 2026-09-01
📖 5 분 읽기🧠 심층 분석

원저자: Yi-Chien Lin, Hongao Zhu, William Schuler

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수십 년 동안 과학자들은 컴퓨터가 거의 생물학적인 속도로 읽고 쓰는 법을 배우는 과정을 지켜봐 왔습니다. 대규모 언어 모델(LLM)로 알려진 이 기계들은 인간의 텍스트가 담긴 방대한 도서관을 학습하여 문장에서 다음 단어를 놀라울 정도로 정확하게 예측할 수 있게 되었습니다. 이들이 언어를 매우 잘 다루기 때문에, 연구자들은 이 기계들이 단순히 우리를 흉내 내는 것이 아니라 우리 뇌가 언어를 처리하는 방식을 실제로 거울처럼 반영하고 있는 것은 아닌지 궁금해하기 시작했습니다. 지배적인 희망은 이러한 모델이 더 커지고 복잡해짐에 따라, 인간이 단어를 읽는 데 걸리는 시간이나 우리가 이야기를 들을 때 뇌가 어떻게 반응하는지를 예측하는 능력이 점점 더 좋아질 것이라는 것이었습니다. 이 아이디어는 이러한 디지털 지능의 구조가 인간 사고의 구조에 대한 지도일 수 있음을 시사했으며, 인간 데이터와 일치하지 않는 모든 실패는 단지 더 많은 컴퓨팅 파워가 필요한 문제일 뿐이라는 점을 암시했습니다.

하지만 오하이오 주립대학교와 캘리포피아 대학교 샌디에이고 캠퍼스의 연구진이 발표한 새로운 연구는 이러한 낙관적인 견해에 도전합니다. 연구진은 모델이 생성하는 데이터의 순수한 크기를 정밀하게 통제했을 때, 모델 크기와 인간 유사 성능 사이의 관계가 특정한 방식으로 변화한다는 것을 발견했습니다. 즉, '추가적인' 학습의 이점이 사라졌습니다. 학습 과정이 더 큰 모델을 학습되지 않은 모델보다 유의미하게 더 낫게 만드는 대신, 가장 큰 모델들은 동일한 크기의 학습되지 않은 버전보다 더 나은 성능을 보이지 않았습니다. 이 연구는 이러한 거대 시스템의 겉보기 성공이 언어에 대한 진정한 이해라기보다는, 그들이 접근할 수 있는 정보의 엄청난 양에 의해 만들어진 일종의 환상이라는 점을 시사합니다. 연구진이 이 이점을 제거하자, 이 모델들을 강력하게 만들었던 학습 과정은 동일한 크기의 완전히 학습되지 않은 버전보다 아무런 추가적인 이점을 제공하지 못하는 것처럼 보였습니다.

이 결론에 어떻게 도달했는지 이해하려면 먼저 이 모델들이 일반적으로 어떻게 테스트되는지를 살펴보아야 합니다. 연구자들은 흔-히 이야기 하나를 언어 모델에 입력하고, 모델의 내부 상태를 인간의 데이터(예를 들어 특정 단어에서 사람이 멈추는 시간이나 문장에 대한 뇌의 반응 등)와 비교합니다. 이전 연구들에서는 더 많은 내부 변수를 가진 더 큰 모델들이 인간의 행동을 지속적으로 더 잘 예측하는 것처럼 보였습니다. 이는 "품질-동력(quality-power)" 가설이라고 불리는 이론으로 이어졌습니다. 즉, 모델이 커질수록 인간의 마음과 더 닮아간다는 것입니다. 그러나 연구진은 이 논리에 숨겨진 결함이 있다고 의심했습니다. 모델이 커지면 단순히 더 똑똑해지는 것이 아니라, 분석할 수 있는 내부 신호(벡터)의 수도 훨씬 많아집니다. 이는 마치 학생에게 질문이 두 배 많은 시험지를 주는 것과 같습니다. 학생이 아무것도 모른다 하더라도, 질문이 더 많으면 운 좋게 정답을 맞힐 기회가 더 많아지기 때문입니다. 연구진은 이전 연구들이 더 나은 뇌를 갖는 것의 이점을 측정하는 것이 아니라, 더 많은 질문을 갖는 것의 이점을 측정했을 수도 있다는 점을 깨달았습니다.

이 수수께끼를 풀기 위해 연구팀은 크기의 효과와 지능의 효과를 분리하는 일련의 실험을 설계했습니다. 그들은 수억 개의 파라미터를 가진 작은 모델부터 660억 개의 파라미터를 가진 거대한 모델에 이르기까지 다섯 가지 다른 계열의 언어 모델 데이터를 수집했습니다. 그리고 이 모델들을 실제 인간 데이터(자연스러운 이야기를 읽는 사람들의 읽기 시간 및 동일한 이야기를 듣는 사람들의 뇌 스캔 데이터 포함)와 대조했습니다. 첫 번째 실험에서 연구진은 이전의 결과들을 재현했습니다. 모델이 커짐에 따라 인간의 행동에 대한 예측력이 실제로 개선되는 것처럼 보였습니다. 이는 "품질-동력" 효과가 표면적으로는 관찰된다는 것을 확인시켜 주었습니다.

하지만 그다음, 그들은 결정적인 통제 변수를 도입했습니다. 연구진은 동일한 모델을 가져와 텍스트를 전혀 학습하지 않은 상태의 모습도 살펴보았습니다. 이 학습되지 않은 모델들은 학습된 모델과 크기와 구조는 정확히 같지만, 본질적으로는 무작위적인 노이즈 상태이며 언어에 대한 지식이 없습니다. 학습된 모델과 학습되지 않은 쌍을 비교함으로써, 연구진은 개선된 부분이 실제 학습에서 온 것인지, 아니면 단순히 더 많은 내부 신호를 보유하고 있기 때문에 발생한 것인지를 확인할 수 있었습니다. 그들은 거대한 학습되지 않은 네트워크가 단순한 분류기에 의해 형성될 수 있는 원재료 역할을 하는 '리저버(reservoir)' 방식과 유사한 방법을 사용했습니다. 만약 학습이 정말로 모델을 더 인간답게 만드는 것이라면, 학습된 버전은 특히 모델이 커질수록 학습되지 않은 버전보다 훨씬 더 뛰어난 성능을 보여야 했습니다.

결과는 놀라웠습니다. 연구진이 내부 신호의 크기를 통제했을 때, 학습의 '추가적인' 이점은 사라졌습니다. 실제로 수십억 개의 파라미터보다 큰 모델들의 경우, 학습된 버전은 학습되지 않은 버전보다 더 나은 성능을 보이지 않았습니다. 여러 데이터셋에서 학습의 추가적인 이점은 0으로 떨어졌습니다. 이는 초기 연구에서 관찰된 막대한 개선이 더 큰 모델이 언어에 대한 더 깊은 이해를 배웠기 때문이 아니라, 단순히 데이터를 맞출 수 있는 내부 차원이 더 많았기 때문임을 의미합니다. 연구진은 모델이 일정 수준을 넘어서면, 모델의 크기 자체만으로 제공되는 예측력에 비해 학습이 기여하는 정도가 0으로 감소한다는 것을 발견했습니다. 모델이 커질수록, 학습 과정이 모델의 크기만으로 제공되는 예측력에 더해주는 이점은 줄어들었습니다.

연구 또한 모델 내의 서로 다른 층(layer)들을 조사하며, 이전 연구에서 더 중요하다고 제안되었던 네트워크의 중간 섹션들이 다르게 행동하는지 확인했습니다. 연구진은 동일한 패턴을 발견했습니다. 모델이 성장함에 따라 모든 층에서 학습의 기여도가 0으로 떨어졌습니다. 모델이 단순히 인간 데이터를 예측하는 능력의 한계에 도달했을 가능성을 고려하여 통계적 방법을 조정했음에도 불구하고, 이 추세는 유지되었습니다. 연구진은 이러한 대규모 모델의 성공이 인간의 인지력을 진정으로 반영하는 것이 아니라, 더 많은 변수를 가짐으로써 더 나은 적합도를 얻게 되는 통계적 효과에 크게 의존한다고 결론지었습니다.

이 발견은 이러한 인공 시스템이 구축되는 방식과 인간의 뇌가 작동하는 방식 사이에 상당한 불일치가 존재함을 시사합니다. 이 모델들을 텍스트 생성에 능숙하게 만드는 학습 과정이 반드시 인간의 읽기나 뇌 활동을 더 잘 모델링하게 만드는 것은 아닙니다. 사실, 이 연구는 이 거대한 네트워크의 학습되지 않은 버전들, 즉 복잡한 무작위 연결의 저장소 역할을 하는 이들이 비싼 비용을 들여 완전히 학습된 버전만큼이나 인간 데이터를 예측하는 데 효과적일 수 있다고 주장합니다. 연구진은 향후 연구에서 학습을 통해 얻은 개선 사항이 실제적인 것인지, 아니면 단순히 모델 크기에 따른 부산물인지를 확실히 하기 위해 이러한 학습되지 않은 모델들을 표준 기준으로 사용해야 한다고 제안합니다. '클수록 좋다'는 아이디어가 수년간 이 분야를 발전시켜 왔지만, 이 연구는 인간의 언어 처리 영역에서 규모와 학습을 더하는 것이 인간의 마음을 이해하는 데 다가가는 것이 아니라, 오히려 우리를 더 멀어지게 할 수도 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →