A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
이 논문은 선형 프로빙(linear probing) 및 희소 오토인코더(sparse autoencoders)와 같은 다양한 언어 모델 해석 가능성 방법들이 어떻게 단일한 필러-역할 결합(filler-role bindings) 구조로부터 유도될 수 있는지를 수학적 및 경험적으로 입증하는 통합 프레임워크로서 텐서 곱 표현(Tensor Product Representations, TPRs)을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 조용하고 웅성거리는 세계에서, 연구자들은 거대한 컴퓨터 프로그램인 언어 모델이 실제로 어떻게 생각하는지 이해하려고 노력하고 있습니다. 이 시스템들은 시를 쓰고, 수학 문제를 풀고, 대화를 나눌 수 있지만, 그 디지털 두뇌 내부에는 정보가 긴 숫자 리스트 형태로 저장되어 있습니다. 수년 동안 과학자들은 이 블랙박스 내부를 들여다보기 위해 다양한 도구들을 사용해 왔으며, 모델들이 놀라울 정도로 질서 정연한 방식으로 정보를 조직하고 있다는 사실을 발견했습니다. 어떤 도구들은 모델들이 이러한 숫자 리스트를 더하고 빼는 방식으로 퍼즐을 풀 수 있음을 보여주며, 다른 도구들은 특정 단어나 아이디어를 마주할 때 모델의 특정 부분이 빛을 발한다는 것을 드러냅니다. 그러나 이러한 발견들은 마치 어두운 집의 서로 다른 방에서 발견된 별개의 단서들처럼 고립되어 있었습니다. 핵심적인 질문은, 이 모든 서로 다른 행동들을 설명할 수 있는 하나의 근본적인 구조가 존재하는지, 아니면 모델들이 그저 관련 없는 기술들의 혼란스러운 뒤섞임에 불과한 것인지 하는 점이었습니다.
예일 대학교의 한 연구팀은 이 수수께끼에 대한 통합적인 해답을 제시했습니다. 그들은 이 복잡한 언어 모델들이 '텐서 곱 표현(Tensor Product Representations)'이라 불리는 특정한 구조적 원리에 기반하여 구축되었다고 제안합니다. 쉽게 말해, 이는 모델들이 정보의 내용(특정 단어와 같은)과 그 정보의 역할(문장 내에서 주어인지 목적어인지와 같은)을 긴밀하게 결합함으로써 정보를 저장한다는 것을 의미합니다. 이것은 모든 정보가 무엇인지뿐만 아니라, 그것이 구조 내에서 정확히 어디에 속하는지까지 함께 저장되는 파일링 시스템과 같습니다. 연구진은 이 단순하고 구조화된 데이터 조직 방식이 이전에 서로 무관해 보였던 광범위한 발견들을 설명할 수 있다는 것을 발견했습니다. 이는 모델들이 수학적 유추를 수행할 수 있는 이유, 단순한 테스트가 숨겨진 개념을 드러낼 수 있는 이유, 그리고 모델의 내부 상태 중 한 부분을 바꾸는 것이 왜 예측 가능한 방식으로 동작을 변화시키는지에 대해 설명해 줍니다.
이 아이디어를 테스트하기 위해, 연구팀은 단순히 이론에만 의존하지 않고, 일종의 번역기 역할을 할 새로운 종류의 도구를 만들었습니다. 그들은 문장의 알려진 구조(주어, 동사, 목적어를 식별하는 것)를 가져와 이를 모델들이 사용하는 특정한 숫자 패턴으로 변환하는 시스템을 구축했습니다. 그런 다음, 이 번역된 버전을 소규모의 단순한 네트워크부터 거대하고 최첨단인 언어 시스템에 이르기까지 여러 가지 컴퓨터 모델의 실제 내부 작동 방식과 비교했습니다. 결과는 매우 일관적이었습니다. 숫자 시퀀스와 구조화된 영어 문장을 포함한 테스트에서, 연구진의 구조적 번역은 모델의 내부 상태와 매우 높은 정밀도로 일치했습니다. 더 단순한 모델들의 경우, 그 일치도는 거의 완벽했으며 정보가 처리되는 방식의 거의 모든 변동을 포착해 냈습니다. 가장 크고 복잡한 언어 모델들의 경우에도, 이 번역기는 대다수의 정보를 포착해 냈으며, 이는 이 거대한 시스템들이 규모에도 불구하고 내용과 위치를 결합하는 동일한 근본적인 방법에 의존하고 있음을 시사합니다.
이 발견의 힘은 서로 다른 조사 방법들을 어떻게 연결하는지에 있습니다. 연구진은 자신들의 구조적 번역에 담긴 수학적 논리가 오늘날 과학자들이 사용하는 네 가지 주요 해석 가능성 기법의 결과를 재현하는 데 사용될 수 있음을 보여주었습니다. 첫째, 그들은 언어 모델이 '가산적 유추(additive analogies)'를 수행할 수 있는 이유를 설명했는데, 이는 하나의 개념에서 다른 개념을 빼고 세 번째 것을 더했을 때 연관된 네 번째 결과가 나오는 현상입니다. 그들의 연구는 모델이 본질적으로 특정 '내용-역할 쌍' 사이의 차이를 계산하기 때문에 이런 일이 발생한다는 것을 입증했습니다. 둘째, 그들은 '선형 프로브(linear probes)'가—모델이 특정 사실을 알고 있는지 감지하는 데 사용되는 단순한 테스트인데—실제로 원래의 아이디어를 추출하기 위해 내용에서 역할을 분리하는 방법이라는 것을 보여주었습니다. 셋째, 복잡한 신호를 더 단순한 부분들로 분해하는 '희소 오토인코더(sparse autoencoders)'가 사실상 이와 동일한 내용 및 역할의 결합을 식별하고 있다는 것을 설명했습니다. 마지막으로, 연구자가 모델의 뇌 일부를 교체하여 행동이 어떻게 변하는지 관찰하는 기술인 '활성화 패칭(activation patching)'이, 바로 이러한 특정한 구조적 결합을 직접 교체하는 작업이기 때문에 작동한다는 것을 입示했습니다.
일련의 실험을 통해 연구팀은 모델을 먼저 학습시키지 않고도 이 네 가지 서로 다른 테스트 도구들을 처음부터 구축할 수 있다는 것을 증명했습니다. 연구진이 이렇게 구축된 도구들을 사용하여 모델을 분석했을 때, 이들은 해당 분야에서 사용되는 기존의 고도로 학습된 도구들과 거의 동일한 성능을 보여주었습니다. 예를 들어, 문장에서 다음에 올 단어를 예측하거나 문장의 주어를 식별하는 데 이들의 방법을 사용했을 때, 그 정확도는 기존의 최선책들과 거의 동일했습니다. 대규모 언어 모델을 대상으로 한 특정 테스트에서는, 연구진의 구조적 예측과 표준 방식 사이의 차이가 거의 보이지 않을 정도로 작았으며, 상관 계수가 거의 1에 달했습니다. 이는 모델의 복잡하고 학습된 행동들이 신비롭거나 우연한 것이 아니라, 이 근본적인 구조적 규칙의 직접적인 결과임을 시사합니다.
연구진은 또한 모델이 새로운 상황에 직면했을 때 이 구조가 얼마나 잘 유지되는지도 탐구했습니다. 그들은 문장 세트를 통해 구조적 번역기를 학습시킨 후, 한 번도 본 적 없는 단어와 역할을 포함하는 문장들에 대해 테스트했습니다. 번역기는 성공적으로 일반화되었으며, 새로운 조합에 대해서도 모델의 내부 상태를 정확하게 재구성했습니다. 이는 모델들이 단순히 특정 사례를 암기하는 것이 아니라, 새로운 내용을 알려진 역할과 결합하는 유연한 시스템을 사용하고 있음을 나타냅니다. 이 연구는 인공지능의 모든 미스터리를 해결했다고 주장하거나 모든 모델이 동일하다고 주장하는 것은 아닙니다. 하지만, 하나의 일관된 프레임워크가 이 시스템들이 세상을 어떻게 표현하는지 설명할 수 있다는 강력한 증거를 제공했습니다. 다양한 해석 가능성 방법들이 모두 동일한 구조적 실체를 가리키고 있음을 보여줌으로써, 이 연구는 고립된 관찰들을 신경망이 작동하는 방식에 대한 단일하고 일관된 그림으로 전환하며, 분야의 통합된 이해에 한 걸음 더 다가갔습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.