Divergent large language model predictions from convergent representations in ambiguous word pairs
이 연구는 디코더 전용 트랜스포머가 초기에는 발산했다가 후기 층에서 내부 표현을 부분적으로 재수렴시킴으로써 어휘적 모호성을 해결하며, 이 과정에서 표준 임베딩 유사도 측정 방식에는 보이지 않게 됨에도 불구하고 서로 다른 예측을 유도하기 위해 의미론적 구분이 지속되는 단절을 생성한다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 디지털 뇌가 어떻게 글을 읽는 법을 배우는지 이해하려고 노력한다고 상상해 보세요. 이 뇌는 대규모 언어 모델(LLM)이라 불리며, 우리가 매일 사용하는 챗봇과 스마트 어시스턴트의 기반이 되는 기술입니다. 세상을 이해하기 위해, 이 모델들은 단순히 단어를 암기하는 것이 아니라, 모든 단어를 **임베딩(embedding)**이라는 수학적 "지문"으로 변환합니다. 이 지문은 거대한 다차원 지도상의 좌표라고 생각하면 됩니다. 만약 두 단어가 비슷한 의미를 가진다면, 그 좌표는 도시의 이웃처럼 서로 가까이 있어야 합니다. 반대로 의미가 다르다면 서로 멀리 떨어져 있어야 합니다.
수년 동안 과학자들은 이 지도를 신뢰해 왔습니다. 그들은 모델이 생성한 단어의 최종 지문을 살펴보면, 그 단어에 대해 모델이 무엇을 생각하는지 정확히 알 수 있다고 믿었습니다. 이 아이디어는 검색 엔진이나 유사한 아이디어를 그룹화하는 앱과 같이 우리가 사용하는 많은 도구의 근간이 됩니다. 하지만 여기에는 함정이 있습니다. 언어는 까다롭습니다. "bank"와 같은 일부 단어는 돈을 보관하는 장소(은행)가 될 수도 있고, 강의 가장자리(둑)가 될 수도 있습니다. 이를 **중의적인 단어(ambiguous words)**라고 부릅니다. 연구자들이 던져온 핵심 질문은 이것입니다. 모델의 최종 지문이 이 두 가지 의미의 차이를 실제로 보여주는가, 아니면 마지막 단계에서 지도가 흐릿하고 혼란스러워지는가?
이 논문은 세 가지 서로 다른 AI 모델(작은 모델, 중간 크기 모델, 매우 큰 모델)이 중의적인 단어를 레이어별로 어떻게 처리하는지 관찰함으로써 이 미스터리를 깊이 파고듭니다. 연구진은 놀랍고도 직관에 반하는 사실을 발견했습니다. 모델이 "bank"와 같은 단어를 처리할 때, 네트워크 중간 단계에서는 "강"의 의미와 "돈"의 의미 사이의 수학적 거리가 실제로 더 넓어졌다가, 마지막 레이어에 도달하면 다시 하나로 줄어든다는 것입니다. 마치 모델이 내부 지도에서 두 의미를 일시적으로 분리했다가, 입을 열기 직전에 다시 같은 동네로 합쳐 놓는 것과 같습니다.
하지만 여기에 반전이 있습니다. 모델의 최종 지문들이 매우 유사해 보일지라도(마치 다시 같은 동네로 돌아온 것처럼), 모델의 예측은 완전히 다릅니다. 모델에게 다음 단어를 추측하라고 요청하면, 모델은 어떤 "bank"에 대해 이야기하고 있는지 정확히 알고 있습니다. 이 연구는 마지막 레이어가 의미의 비밀을 쥐고 있지만, 단순한 거리 측정(예: 간단한 거리 체크)으로는 볼 수 없는 방식으로 그것을 숨기고 있다는 것을 보여줍니다. 모델은 혼란에 빠진 것이 아니라, 마지막 레이어에서 유사해 보이지만 실제로는 차이를 나타내는 비밀 코드를 사용하고 있는 것입니다. 이는 단지 최종 "지문"만을 보고 AI가 무엇을 생각하는지 이해하려는 시도가 오해를 불러일생킬 수 있음을 시사합니다. 왜냐하면 가장 중요한 구별점들이 사라진 것처럼 보이는 방식으로 여전히 존재하며, 모델의 행동을 주도하고 있기 때문입니다.
변화하는 지도의 이야기
이것이 어떻게 작동하는지 이해하기 위해, AI 모델을 비밀 노트를 긴 줄을 따라 전달하는 64명의 형사 팀(가장 큰 모델인 Qwen2.5의 경우)이라고 상상해 보세요. 각 형사는 모델의 "레이어"를 나타냅니다. 노트에 "bank"라고 적혀 있을 때, 처음 몇 명의 형사는 단어의 형태만 보고 있습니다. 그들은 아직 이것이 강인지 은행인지 모릅니다. 그래서 그들의 노트는 거의 동일해 보입니다.
노트가 중간 단계의 형사들에게 전달되면, 마법 같은 일이 일어납니다. 이 형사들은 문맥, 즉 "bank"의 앞뒤에 오는 단어들에 주목하기 시작합니다. 한 형사는 근처에 "river"가 있는 것을 보고 노트에 커다란 빨간 점을 찍습니다. 다른 형사는 "money"를 보고 파란 별을 찍습니다. 이 중간 단계에서, 두 의미의 노트는 밤과 낮처럼 확연히 다릅니다. 만약 여기서 둘 사이의 거리를 측정한다면, 그들은 서로 멀리 떨어져 있을 것입니다.
하지만 그 후, 노트는 마지막 형사들에게 도달합니다. 여기서 이야기는 더욱 흥미로워집니다. 마지막 형사들은 그 뚜렷한 빨간 점과 파란 별을 가져와서 매우 비슷해 보이는 노트로 다시 접어 넣습니다. 만약 여러분이 "river bank"와 "money bank"의 최종 노트를 측정한다면, 그것들은 다시 거의 동일해 보일 것입니다. 마치 형사들이 "보스에게 혼란을 주지 않도록 최종 보고서를 똑같이 만들자"라고 결정한 것과 같습니다.
그러나 보스(모델의 출력)는 속지 않습니다. 최종 노트가 비슷해 보일지라도, 형사들은 차이를 비밀스럽게 인코딩하여 최종 답변을 바꿉가 있습니다. 모델이 다음 단어를 예측할 때, 비록 최종 노트가 "river"에 속하는 것처럼 보일지라도, 모델은 "river"와 관련된 단어를 말하지 않습니다.
연구진은 "스위치 바꾸기(switcheroo)" 게임을 통해 이를 증명했습니다. 그들은 "river" 문맥의 최종 노트를 가져와서 "money" 문맥 속으로 바꿨습니다. 그렇게 했을 때, 모델은 생각을 완전히 바꾸어 강과 관련된 단어를 예측하기 시작했습니다. 이는 최종 레이어가 비록 두 의미가 다시 합쳐진 것처럼 보일지라도, 여전히 차이를 보유하고 있음을 증명했습니다. 차이는 여전히 존재하지만, 노트의 모양 자체가 아니라 다음 단계를 위한 지침 속에 숨겨져 있는 것입니다.
지도가 오해를 불러일으키는 이유
이 발견은 마술사의 트릭과 비슷합니다. 트래직의 끝에서 마술사의 손만 본다면, 손은 비어 있고 동일해 보일 것입니다. 하지만 공연 전체를 지켜봤다면, 마술사가 내내 두 개의 서로 다른 공을 저글링하고 있었다는 것을 알게 될 것입니다. 연구진은 중의적인 단어의 경우, 의미가 명확히 분리되는 중간 레이어에서 이 "저글링"이 일률적으로 일어난다는 것을 발견했습니다. 하지만 트릭이 끝날 때쯤이면 공들은 다시 숨겨지고, 손은 똑같아 보입니다.
이 논문은 GPT-2(1억 1,700만 파라미터), Llama-3.2(30억 파라미터), Qwen2.5(320억 파라미터)라는 세 가지 서로 다른 모델을 통해 이를 테스트했습니다. 크기와 구조가 다름에도 불구하고, 그들은 모두 똑같은 행동을 했습니다. 중간에서 의미를 분리한 다음, 마지막에 다시 하나로 합치면서도, 정확히 어떤 의미를 사용해야 할지는 알고 있었습니다.
또한 연구진은 이것이 단순히 문장 내 단어의 위치 때문에 발생하는 우연인지 확인했습니다. 그들은 문장의 단어 순서를 바꾸어(예: "The cat chased the mouse"를 "The mouse chased the cat"으로 변경) 실험했고, 모델의 행동이 단순히 단어 순서가 아닌 의미에 의해 구동된다는 것을 발견했습니다. 이는 모델이 진정으로 중의성을 이해하고 있음을 확인시켜 주었습니다.
이것이 미래에 갖는 의미
이 발견의 핵심은 우리가 지도의 잘못된 부분을 보고 있었을지도 모른다는 것입니다. 오랫동안 사람들은 AI의 마지막 레이어에서 두 가지가 비슷해 보인다면, 그것은 같은 것을 의미한다고 가정해 왔습니다. 이 논문은 그것이 항상 사실은 아니라고 제안합니다. 마지막 레이어는 마치 사람들이 아주 가까이 서 있는 북적이는 방처럼 보일 수 있지만, 그들이 하는 말(예측)을 들어보면 그들이 완전히 다른 주제에 대해 논쟁하고 있다는 것을 깨닫게 될 것입니다.
이것이 AI가 고장 났다는 뜻은 아닙니다. 단지 정보를 저장하는 방식이 단순한 거리 차트보다 훨씬 더 복잡하다는 것을 의미할 뿐입니다. 연구진은 우리가 더 나은 검색이나 정보 조직 도구를 만들고 싶다면, 의미가 명확히 분리되는 중간 레이어를 살펴보거나, 단순히 지문의 근접도를 측정하는 대신 모델이 무엇을 예측하는지에 귀를 기울여야 할 수도 있다고 제안합니다.
이 연구는 마법 같은 해결책이나 새로운 모델 구축 방법을 찾아낸 것은 아니지만, 이 모델들이 어떻게 생각하는지에 대한 퍼즐을 풀었습니다. 그것은 중의성 해소의 "마법"이 마지막 레이어에서 사라진 것이 아니라, 단지 올바른 단서를 찾기 위해 기다리며 눈앞에 숨겨져 있을 뿐이라는 것을 보여주었습니다. 연구진은 다양한 모델과 다양한 유형의 중의적 단어를 사용하여 이 결과가 일관되게 나타났음을 확인했기에 이 결과에 자신감을 가지고 있습니다. 이는 AI의 세계에서 사물이 보이는 그대로가 아닐 수 있으며, 때때로 가장 중요한 차이는 자로 잴 수 없는 눈에 보이지 않는 차이라는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.