Linear representations of grammaticality in neural language models
이 논문은 문법성이 다양한 사전 학습된 신경 언어 모델의 내부 상태 내에서 별개의 표상적 차원으로 견고하고 독립적으로 인코딩되어 있음을 입증하며, 이를 통해 이들의 통사적 역량을 평가하기 위한 확률 독립적인 프레임워크를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 인간의 언어를 이해하도록 가르치려 한다고 상상해 보세요. 당신은 수백만 권의 책, 영화, 트윗을 로봇에게 입력했고, 로봇은 문장에서 다음에 올 단어를 놀라울 정도로 정확하게 예측하는 법을 배웠습니다. 하지만 여기 과학자들을 밤잠 설치게 만든 거대한 미스터리가 있습니다. 이 로봇이 실제로 문법 규칙을 '아는' 것일까요, 아니 아니면 그저 숙련된 추측가에 불나한 것일까요?
언어학과 컴퓨터 과학의 세계에는 이와 관련된 유명한 논쟁이 있습니다. 한쪽에서는 이 로봇들(신경 언어 모델이라 불리는)이 본 것을 바탕으로 다음에 올 확률을 계산하도록 훈련되었기 때문에, 그저 '가능성(likelihood)'을 계산하고 있을 뿐이라고 주장합니다. 이들은 어떤 문장이 '좋다'고 생각하는 이유가 단순히 그 문장이 익숙하기 때문이지, 보이지 않는 추상적인 문법 규칙을 따르기 때문은 아닐 수도 있다는 것입니다. 반대편에서는 만약 로봇이 올바른 문장과 망가진 문장을 일관되게 구별할 수 있다면, 설령 그것을 설명하지 못하더라도 반드시 규칙을 학습한 것이라고 믿습니다. 문제는 오랫동안 이 모델을 테스트하는 유일한 방법이 로봇에게 "이 문장이 얼마나 가능성이 높은가?"라고 묻는 것이었다는 점입니다. 만약 로봇이 문법적으로 틀렸지만 흔히 쓰이는 단어들을 사용했다는 이유만으로 "매우 높음!"이라고 답한다면, 우리는 로봇이 문법을 아는 것인지 아니면 단지 통계를 알고 있는 것인지 구분할 수 없습니다.
"신경 언어 모델의 문법성의 선형적 표현(Linear Representations of Grammaticality in Neural Language Models)"이라는 제목의 이 논문은 바로 이 복잡한 논쟁 속으로 뛰어듭니다. 저자인 제인 리(Jane Li)와 나정 킴(Najoung Kim)은 로봇에게 문장의 가능성을 묻는 방식을 그만두기로 했습니다. 대신, 그들은 로봇의 뇌 내부를 들여다보기로 했습니다. 그들은 로봇의 내부적 '생각'(문장에 대한 수학적 표현) 안에 '문법적인' 문장과 '비문법적인' 문장이 서로 다른 구역에 모여 사는 특별하고 조직적인 공간이 존재하는지 확인하고 싶었습니다. 만약 그들이 로봇의 마음속에서 이 두 집단을 분리하는 명확한 선을 찾아낼 수 있다면, 이는 로봇이 단순히 '무엇이 흔한가'라는 개념이 아니라 '문법'이라는 개념을 진정으로 학습했다는 강력한 증거가 될 것입니다.
탐정 작업: 뇌 내부를 들여다보기
이 미스터리를 해결하기 위해 연구진은 '선형 프로빙(linear probing)'이라는 영리한 기술을 사용했습니다. 로봇의 뇌를 거대한 다차원 지도로 상상해 보세요. 로봇이 읽는 모든 문장은 이 지도 위의 특정 점으로 변환됩니다. 만약 로봇이 단지 단어가 얼마나 흔한지에만 관심이 있다면, 점들은 무작위로 흩어져 있거나 문장의 길이에 따라 그룹화될 것입니다. 하지만 로봇이 실제로 문법을 이해하고 있다면, 이 지도 위에는 '좋은 문장'이 한쪽에 있고 '나쁜 문장'이 다른 쪽에 있는 명확한 방향이 존재해야 합니다.
연구진은 1,400만 개의 파라미터를 가진 아주 작은 모델부터 140억 개의 파라미터를 가진 거대한 모델까지 총 25개의 서로 다른 언어 모델을 가져와 테스트했습니다. 그들은 모델들에게 수천 개의 문장을 입력했습니다. 어떤 문장은 완벽하게 문법적이었고, 어떤 문장은 "This dog like to jump"처럼 "This dog likes to jump" 대신 의도적으로 아주 작은 오류를 넣은 문장이었습니다. 그런 다음, 그들은 로봇의 내부 지도 속에서 좋은 문장과 나쁜 문장을 분리할 수 있는지 확인하기 위해 단순한 직선 하나를 그려보았습니다.
거대한 발견: 문법은 실재하며, 선형적이다
결과는 흥미로웠습니다. 그들은 테스트한 거의 모든 모델에서 명확한 '선'이 존재한다는 것을 발견했습니다. 매우 단순하고 복잡도가 낮은 분류기조차도 로봇의 내부 표현을 보고 "아, 이것은 문법적이다" 또는 "아니, 저것은 망가졌다"라고 말할 수 있었습니다. 이는 문법성이 이 모델들에게 있어 단순히 모호한 느낌이 아니라, 내부 공간 속에 존재하는 뚜렷하고 조직적인 차원임을 시사합니다.
하지만 연구진은 거기서 멈추지 않았습니다. 로봇이 문장을 분리할 수 있다고 해서, 그것이 반드시 '문법' 때문에 분리하는 것은 아닐 수도 있다는 것을 알고 있었기 때문입니다. 어쩌면 그저 문장이 덜 흔해서, 혹은 이상하게 들려서, 혹은 단어 수가 적어서 분리하는 것일 수도 있습니다. 이것이 정말 문법에 관한 것임을 증로하기 위해, 그들은 몇 가지 '혼란 제거(deconfounding)' 게임을 수행했습니다.
확률의 함정:
첫째, 그들은 "로봇이 단지 문장의 발생 가능성만을 보고 있는 것인가?"라고 물었습니다. 그들은 까다로운 시나리오를 만들었습니다. 문법적으로는 맞지만 '매우 드문(unlikely)' 문장과, 문법적으로는 틀렸지만 '매우 흔한(likely)' 문장을 섞어 놓은 것입니다. 만약 로봇이 단순한 확률 계산기라면 혼란에 빠져 실패했어야 합니다. 하지만 로-봇은 그렇지 않았습니다. 로봇은 여전히 드물지만 올바른 문장을 문법적이라고 식별했고, 흔하지만 틀린 문장을 비문법적이라고 식별했습니다. 이는 로봇의 '문법 탐지기'가 문장이 현실에서 나타날 확률과는 독립적임을 시사합니다.
"엉뚱한 문장" 테스트:
다음으로, 그들은 로봇이 문장이 얼마나 '타당한지(sensible)' 또는 '그럴듯한지(plausible)'를 판단하는 것인지 궁금했습니다. 그들은 문법적으로는 완벽하지만 의미가 통하지 않는 문장(예: "바위가 샌드위치를 먹었다")과, 문법적으로는 틀렸지만 의미는 통하는 문장(예: "샌드위치가 바위를 먹었다")을 테스트했습니다. 연구진은 로봇이 '엉뚱함'을 인지하고 있다는 것을 발견했지만, 동시에 로봇은 문법을 위한 별도의 견고한 신호를 가지고 있다는 것도 발견했습니다. 로봇의 뇌 속에 있는 '문법 선'은 '엉뚱함 선'과는 구별되는 것이었습니다.
보편적 번역기:
마지막으로, 그들은 이 문법 지식이 영어에 국한된 것인지, 아니면 보편적인 기술인지 확인했습니다. 그들은 러시아어, 프랑스어, 독일어, 히브리어, 중국어를 사용하여 모델을 테스트했습니다. 그 결과, 더 크고 강력한 모델들의 경우 문법을 감지하는 능력이 단순히 영어만의 기술이 아니라는 것을 발견했습니다. 다양한 언어에 걸쳐 동일한 종류의 '내부 문법 선'이 존재했으며, 이는 이 모델들이 구조를 이해하는 일반적이고 언어 독립적인 방식을 발전시켰음을 시사합니다.
이것이 미래에 갖는 의미
이 논문은 신경망이 실제로 문법성에 대한 견고한 내부 표현을 보유하고 있다고 결론짓습니다. 이것은 단순히 다음에 올 단어를 잘 맞히는 과정에서 생기는 부수적인 효과가 아니라, 정보가 조직되는 방식의 근본적인 부분입니다.
하지만 저자들은 이것이 모든 것에 대한 최종적인 답변이라고 말하는 데 주의를 기울입니다. 그들은 '문법 선'이 존재하긴 하지만 항상 완벽한 것은 아니라고 언급합니다. 작은 모델들은 큰 모델들보다 더 많이 고전하며, 특정 유형의 문법 오류는 감지하기 더 어렵다는 점도 지적합니다. 또한 모델들이 이러한 내부 지식을 가지고 있더라도, 그것이 인간이 문장을 판단하는 방식과 항상 완벽하게 일치하는 것은 아니라고 말합니다.
궁극적으로, 이 연구는 대화의 흐름을 바꿉니다. 우리는 이제 이 모델들이 문법을 아는지에 대해 더 이상 논쟁할 필요가 없습니다. 증거는 그들이 알고 있다는 것을 보여줍니다. 새로운 질문은 '그들이 어떻게 배웠는가', '그 지식의 깊이가 어디까지인가', 그리고 '그것이 학습의 본질에 대해 무엇을 말해주는가'입니다. 통계적 시스템이 추상적인 규칙에 대한 명확하고 선형적인 이해를 발달시킬 수 있다는 것을 보여줌으로써, 이 논문은 문법을 파악하는 능력이 뇌 속의 특별한 '규칙 책'을 필요로 하는 것이 아니라, 데이터의 패턴을 학습하는 순수한 힘으로부터 자연스럽게 창발할 수 있음을 시사합니다. 이는 기계의 마음을 엿보는 매혹적인 장면이며, 스승 없이도 로봇이 작동하는 문장과 그렇지 않은 문장의 차이를 구별하는 법을 배울 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.