Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review
본 리뷰는 사전 학습된 트랜스포머의 주어-동사 일치, 부정, 그리고 구성적 일반화에 관한 표상적, 행동적, 기제적 관점의 증거들을 종합하여 수렴과 파편화의 뚜렷한 패턴을 밝히고, 궁극적으로 현재의 한계를 명확히 하며 향후의 교차 수준 연구를 안내하기 위한 접근성 및 사용 진단법을 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어는 단순한 아이디어를 결합하여 무한히 새로운 생각을 만들어낼 수 있게 해주는 규칙의 체계입니다. 수십 년 동안 과학자들은 현재 유창한 텍스트를 작성하고 복잡한 질문에 답하는 거대한 컴퓨터 프로그램들이 실제로 이러한 규칙을 학습한 것인지, 아니면 단지 이전에 보았던 패턴을 흉내 내는 것뿐인지 궁금해해 왔습니다. 사전 학습된 언어 모델(pretrained language models)로 알려진 이 프로그램들은 방대한 양의 인간 저술 데이터를 바탕으로 훈련됩니다. 이들은 완벽하게 자연스러운 문장을 생성할 수 있어, 많은 이들이 이 모델들이 인간과 같은 방식으로 문법과 의미를 이해한다고 가정하게 만듭니다. 그러나 적절한 단어를 만들어내는 것이 왜 그 단어들이 함께 있어야 하는지를 아는 것과 같지는 않습니다. 프로그램은 우연히, 혹은 근본적인 논리를 파악하지 못한 채 지름길에 의존하여 문장을 맞출 수도 있습니다. 이 미스터리를 풀기 위해 연구자들은 모델 내부의 메모리에 어떤 정보가 저장되어 있는지 확인하고, 출력물에서 실제로 무엇을 만들어내는지 테스트하며, 특정 결정의 원인이 되는 경로를 추적하는 세 가지 서로 다른 방법을 개발했습니다.
연구자 이즈헤 왕(Yizhe Wang)과 젠화 링(Zhenhua Ling)의 새로운 리뷰 논문은 이 세 가지 관점을 결합하여 이들이 동일한 이야기를 하는지 살펴봅니다. 저자들은 모델이 어떻게 작동하는지 이해하는 데 필수적인 세 가지 특정 언어 영역, 즉 동사가 주어와 어떻게 일치하는지, 단어 "not"이 문장의 의미를 어떻게 바꾸는지, 그리고 모델이 익숙한 부분들을 결합하여 어떻게 새로운 복잡한 아이디어를 만들어내는지에 집중했습니다. 이 세 가지 방법을 사용한 수백 개의 연구를 수집하고 비교함으로써, 연구자들은 그 답이 질문하는 언어의 부분이 무엇인지에 따라 전적으로 달라진다는 것을 발견했습니다. 때때로 세 가지 방법으로부터 얻은 증거가 완벽하게 일치하기도 하지만, 다른 경우에는 방법들이 서로 상충하는 이야기를 들려주며 모델이 실제로 알고 있는 것에 대한 공백을 드러내기도 합니다.
연구자들이 발견한 가장 명확한 성공 사례는 단수 주어에는 단수 동사가 필요하고(예: "the cat runs"), 복수 주어에는 복수 동사가 필요한(예: "the cats run") 주어-동사 일치 규칙을 다루는 경우였습니다. 이 영역에서는 모델을 바라보는 세 가지 방식이 일치합니다. 연구자들이 모델의 내부 상태를 조사했을 때, 명사가 단수인지 복수인지를 나타내는 명확한 신호를 찾을 수 있었습니다. 모델의 출력을 테스트했을 때도 모델은 거의 항상 올바른 동사 형태를 선택했습니다. 가장 중요한 점은, 연구자들이 그 내부 신호를 변경하도록 개입했을 때 모델의 행동이 예측 가능한 방식으로 변하며 잘못된 동사를 선택하도록 강제했다는 것입니다. 이러한 수렴은 단순한 문법 규칙에 대해 이 모델들이 관계를 진정으로 학습하고 이를 의도대로 사용하고 있음을 시사합니다.
부정, 즉 모델이 "not"이라는 단어를 어떻게 처리하는지를 살펴보면 상황은 훨씬 더 복잡해집니다. 여기서 세 가지 렌즈는 일치하지 않습니다. 내부 점검 결과 모델은 "not"의 존재를 감지하고 그것이 문장에서 대략 어디에 적용되는지는 이해할 수 있는 것으로 나타났습니다. 그러나 모델에게 부정된 문장을 바탕으로 텍스트를 생성하거나 질문에 답하도록 요청하면, 모델은 종-종 올바른 의미를 적용하는 데 실패합니다. 모델은 "not"이라는 단어를 인지하면서도 여전히 문장이 긍정문인 것처럼 행동할 수 있습니다. 연구자들은 모델이 표식(marker)은 포착할 수 있지만, 그것을 사용하여 문장의 진술을 뒤집는 데는 신뢰할 만한 수준으로 활용하지 못한다는 것을 발견했습니다. 이는 마치 모델이 표지판은 보되 그 표지판이 주는 지시사항은 따르지 않는 것과 같습니다. 이러한 불일치는 모델이 정보의 조각들은 가지고 있을지언정, 전체 의미를 이해하기 위해 그것들을 일관되게 사용하지는 못한다는 것을 의미합니다.
언어의 각 부분을 결합하여 새로운 의미를 만들어내는 능력을 다루는 세 번째 영역은 가장 혼란스러운 모습을 보입니다. 이는 모델이 알고 있는 단어와 규칙을 한 번도 본 적 없는 상황에 적용하는 능력입니다. 이 부분의 증거는 파편화되어 있습니다. 어떤 연구들은 연구자가 힌트를 제공하거나 과업을 작은 단계로 나눌 때 모델이 단순한 조합을 처리할 수 있음을 보여줍니다. 반면, 모델이 스스로 복잡한 추론의 사슬을 해결하도록 내버려 두었을 때 모델이 자주 실패한다는 것을 보여주는 다른 연구들도 있습니다. 문제는 서로 다른 연구들이 서로 다른 것을 보고 있다는 점입니다. 어떤 연구는 모델이 패턴을 인식할 수 있는지를 테스트하는 반 것이며, 다른 연구는 모델이 기초부터 새로운 아이디어를 구축할 수 있는지를 테스트하는 것입니다. 연구자들은 이 능력을 모든 연구에서 일관되게 측정할 수 있는 단일한 방법을 찾을 수 없었기에, 모델이 아이디어를 결합하는 일반적인 기술을 실제로 보유하고 있는지, 아니면 단순히 특정한 좁은 기술에 능숙한 것인지 결론 내릴 수 없었습니다.
리뷰의 저자들은 이러한 서로 다른 결과가 일부 언어적 특징이 다른 특징보다 고립시키고 사용하기 더 쉽기 때문에 발생한다고 제안합니다. 주어-동사 일치의 경우, 그 특징이 단순하고 고립되어 있어 모델이 이를 찾아내고 사용할 수 있습니다. 부정의 경우, 모델은 표식을 찾을 수는 있지만 그것을 통해 전체 의미를 바꾸는 데는 어려움을 겪습니다. 복잡한 조합의 경우, 그 특징이 너무 넓게 퍼져 있고 정의하기 어려워서 모델이 그것을 명확하게 고립시키는 것조차 불가능합니다. 연구자들은 이러한 모델들이 일반적인 의미에서 언어를 알고 있다고 가정해서는 안 된다고 결론짓습니다. 대신, 그들의 지식은 작업에 따라 구체적입니다. 그들은 동사를 맞추는 것과 같은 일부 작업에는 탁월하지만, 부정을 이해하는 것과 같은 다른 작업에는 일관성이 없으며, 기존의 부분들로부터 새로운 아이디어를 만드는 가장 복잡한 작업에 대해서는 여전히 검증되지 않았습니다. 이 발견은 우리가 이러한 시스템을 평가하는 방식을 변화시킵니다. 우리는 단지 모델이 정답을 맞히는지 확인하는 것에 그치지 않고, 그곳에 도달하기 위해 올바른 논리를 사용하고 있는지도 반드시 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.