Laguerre Geometry for Interpreting Large Language Models
이 논문은 LLM의 개념을 점이 아닌 공간 영역으로 재정의하는 라게르 기하학(Laguerre Geometry) 프레임워크를 도입하여, 트랜스포머 모델의 내부 추론 궤적과 계층 구조를 정밀하게 시각화, 측정 및 조작할 수 있는 Geometric Lens 및 Laguerre Autoencoder와 같은 학습이 필요 없는 도구의 개발을 가능하게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(LLM)을 모든 단어가 다음에 올 수 있는 가능한 단어를 나타내는 책들로 가득 찬, 거대하고 다층적인 도서관이라고 상상해 보십시오. 오랫동안 과학자들은 이 도서관 내부의 모든 "아이디어"나 "개념"이 단순히 방의 지도 위에 찍힌 하나의 아주 작은 핀이라고 생각했습니다. 만약 당신이 "개(Dog)"라는 개념을 찾고 싶다면, 그저 특정 핀 하나를 찾으면 된다고 믿었습니다.
하지만 이 새로운 논문은 그러한 관점이 너무 단순하다고 제안합니다. 저자들은 개념이 하나의 핀이 아니라 벽과 바닥, 천장이 있는 하나의 방 전체라고 제로합니다. 그들은 이를 "라게르-보로노이 셀(Laguerre-Voronoi cell)"이라고 부릅니다. 이것은 도시의 구역(neighborhood)과 같습니다. "개"는 단순히 집 한 채가 아니라, "고양이"나 "새"와 구분되는 보이지 않는 울타리로 둘러싸인, 개와 관련된 모든 아이디어가 모여 있는 블록 전체를 의미합니다.
모든 것을 바꾼 지도
저자인 Chunwei Ma와 Russell D. Wolfinger는 이 지도를 그리기 위해 **라게르 기하학(Laguerre Geometry)**이라는 수학 분야를 사용했습니다. 이 기하학에서 모든 개념은 중심(마치 마을 광장처럼)과 특별한 "가중치(weight, 영향력의 반지름 같은 것)"를 가집니다.
여기서 그들이 발견한 결정적인 반전이 있습니다: 가중치가 중요합니다.
단순히 두 단어가 서로 얼마나 가까운지(거리)만 본다면, "강아지"(개의 일종)와 "포유류"(개를 포함하는 범주)의 차이를 구별할 수 없습니다. 단순한 지도에서는 두 개념이 똑같이 가깝게 보일 수 있습니다. 하지만 라게르 기하학을 통해 "가중치"를 추가하면, 지도는 계층 구조를 드러냅니다. 즉, "강아지"는 "개"의 방 안에 있고, "개"는 "포유류"의 방 안에 있다는 것을 보여줍니다. 수학적으로 이들은 마치 러시아 인형(nesting dolls)처럼 중첩되어 있으며, 오직 이 특정한 기하학적 렌즈를 통해서만 이러한 중첩 구조를 볼 수 있다는 것을 증명했습니다.
기계 내부를 들여다보기
이 논문은 또한 모델이 문장을 완성하기 전, 문장 중간에서 무엇을 생각하고 있는지에 대한 미스터리를 다룹니다.
당신이 모델에게 "프랑스의 수도는..."이라고 묻는다고 상상해 봅시다.
- 기존의 관점 (Logit Lens): 과학자들은 모델이 첫 단어부터 정답인 "Paris"를 향해 천천히 이동한다고 생각했습니다.
- 새로운 관점 (Geometric Lens): 저자들은 모델의 "사고 과정"을 실시간으로 관찰하기 위해 Geometric Lens라는 도구를 만들었습니다. 그들은 모델의 내부 경로가 훨씬 더 혼란스럽고 흥미롭다는 것을 발견했습니다.
실험에서, 저자들은 모델이 문장을 처리함에 따라 내부의 생각들이 어떻게 서로 다른 "방(영역)"들을 통과하며 여행하는지 관찰했습니다.
- 처음에 모델은 많은 선택지를 고려합니다.
- 그 후, 중간 레이어에서 (공백이 없는) 사실적으로 올바른 단어인 "Paris"를 포착하는 것처럼 보입니다.
- 마지막으로, 아주 마지막 단계에서 모델은 출력을 내보내기 전, 문법적으로 올바른 형태인 "_Paris"(공백이 포함된 형태)로 스스로를 수정합니다.
Geometric Lens만이 이 전체 여정을 포착할 수 있었습니다. 다른 도구들은 너무 일찍 멈춰버리거나 중간 단계를 완전히 놓쳤습니다.
모델이 혼란에 빠질 때
저자들은 모델을 속이려고 시도할 때 어떤 일이 일어나는지도 테스트했습니다. 그들은 다음과 같은 프롬프트를 주었습니다: "당신은 마르세유와 리옹의 이름이 바뀐 가상의 세계에 있습니다. 루브르 박물관은..."
보통 모델은 이 가짜 이야기에 혼란을 느껴 실제 정답인 "Paris" 대신 "Lyon"이나 "Marse유"라고 답할 수 있습니다.
하지만 저자들이 Geometric Lens를 사용하여 모델이 타이핑을 마치기 전(특히 레이어 20에서)의 생각을 살펴보았을 때, 놀라운 사실을 발견했습니다: 모델은 내심 진실을 알고 있었습니다. 최종 답변은 가짜 이야기에 휩쓸려 틀렸을지라도, Geometric Lens는 모델의 내부 "생각"이 가짜 이야기에 의해 휩쓸리기 전, 잠시 동안 정답인 "Paris"를 방문했음을 보여주었습니다.
이것이 의미하는 바 (그리고 의미하지 않는 것)
이 논문은 우리가 개념을 단일 점이 아니라 특정 모양과 가중치를 가진 전체 영역으로 생각해야 한다고 제안합니다. 그들은 이러한 영역이 존재하며 선형적으로 분리 가능하다는 것(즉, 두 개의 서로 다른 개념 방 사이에 직선을 그을 수 있음)을 수학적으로 증명했습니다.
그들은 Phi-2와 Gemma-2 같은 실제 모델을 사용하여 이를 측정했습니다. 개념을 정의하는 다양한 방식들을 비교하는 테스트에서, 그들의 "라게르(Laguerre)" 방식은 이전 방식보다 "동물"과 "식물"을 구분하는 데 더 효과적이었습니다. 예를 들어, Phi-2 모델에서 그들의 방식은 "범주적 기하학(Categorical Geometry)" 방식의 오류율인 0.121보다 낮은 0.111의 오류율을 기록하며 동물을 식물과 더 잘 구분해 냈습니다.
또한 그들은 "Geometric Lens"가 혼란스러운 프롬프트 상황에서 모델의 진정한 추론을 포착하는 데 더 뛰어나다는 것을 입증했습니다. "Paris" 간섭 테스트에서, Geometric Lens는 Phi-2 모델에서 0.56의 정확도로 올바른 토큰을 회복해 냈으며, 이는 Patchscopes의 0.55와 Logit Lens의 0.05를 능가하는 수치입니다.
결론
이 논문은 AI의 모든 미스터리를 해결했다고 주장하는 것이 아닙니다. 아직 모델을 어떻게 제어할지에 대해서는 말하지 않습니다(그것은 향아 연구 과제입니다). 하지만 이 논문은 블랙박스 내부에서 무슨 일이 일어나고 있는지 볼 수 있는 더 명확하고 새로운 방법을 제시합니다. 모델의 지능은 단순히 A에서 B로 가는 직선이 아니라, 모델이 여러 아이디어를 방문하고, 무게를 달고, 말을 내뱉기 전에 때때로 마음을 바꾸기도 하는 '방들의 도시'를 통과하는 복잡한 여정임을 시사합니다. 그리고 라게르 기하학 덕분에, 우리는 이제 단순한 점이 아닌 전체 동네를 보여주는 지도를 갖게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.