Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models
이 논문은 은닉 마르코프 모델에 대한 사전 학습된 거대 언어 모델(LLM)의 인컨텍스트 학습 성능과 그 내부 메커니즘 사이의 간극을 후보 알고리즘을 경험적으로 좁히고, 트랜스포머 구현을 이론적으로 검증하며, 이러한 예측을 주도하는 저차원 선형 표현을 식별하고 인과적으로 조작하기 위한 주성분 활성화 프로브(Principal Activations Probe)를 도입함으로써 메웁니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 탐정이 되어, 지문 대신 거대한 컴퓨터 뇌 속의 보이지 않는 "생각"을 추적하며 미스터리를 풀고 있다고 상상해 보세요. 이 과학 분야를 **기계론적 해석 가능성(mechanistic interpretability)**이라고 부르며, 이는 *기계가 실제로 어떻게 생각하는가?*라는 단순하지만 까다로운 질문을 던집니다. 이 논문의 미스터리를 이해하기 위해, 먼저 기계가 무엇을 해결하려고 하는지 알아야 합니다. 기계는 **은닉 마르코프 모델(Hidden Markov Models, HMM)**이라는 게임을 하고 있습니다. HMM을 하늘이 보이지 않는 일기 예보라고 생각해 보세요. 당신은 오직 지면만을 볼 수 있습니다. 땅이 젖어 있는지 아니면 말라 있는지, 잔디가 초록색인지 아니면 갈색인지 말이죠. "은닉된(hidden)" 부분은 실제 날씨(맑음, 비, 흐림 등)인데, 이는 직접 볼 수는 없지만 지면의 상태를 결정짓는 원인이 됩니다. 컴퓨터의 임무는 젖은 잔디와 마른 보도블록의 긴 역사를 보고 다음 날씨가 어떨지 추측하는 것입니다.
한동안 과학자들은 우리가 매일 사용하는 거대 언어 모델(LLM)—매우 똑똑한 AI 챗봇들—이 이 추측 게임에 믿기 힘들 정도로 뛰어나다는 사실을 알고 있었습니다. 문맥(context)이 길어질수록, 그들의 예측은 이론적으로 가능한 최상의 성능(오라클, Oracle)에 근접했으며, 동일한 데이터에 적용된 고전적인 추론 알고리즘과 대등하거나 심지어 능가하기도 했습니다. 하지만 아무도 그것이 어떻게 가능한 것인지는 알지 못했습니다. AI가 비밀리에 확률 법칙을 배운 것일까요? 패턴을 암기하고 있는 걸까요? 아니면 어떤 기묘하고 새로운 기술을 사용하고 있는 걸까요? 그것은 마치 마술사가 모자에서 토끼를 꺼내는 것을 보면서, 그 안에 숨겨진 칸이 있는지, 두 번째 토끼가 있는지, 아니면 마법 주문이 쓰였는지 전혀 알 수 없는 것과 같았습니다. 이 논문은 연구자들이 마술사의 모자 안을 들여미 보고 AI가 정확히 어떤 기술을 사용하는지 확인하는 데 성공한 첫 사례입니다.
연구진은 AI의 비밀 전략을 밝혀내기 위해 거대한 실험을 설계했습니다. 먼저, 그들은 인간이 이 날씨 추측 게임을 풀기 위해 사용하는 다양한 수학적 알고리즘인 "알려진 용의자" 목록을 대상으로 AI를 테스트했습니다. 그 결과, 단 하나의 인간 알고리즘만으로는 모든 상황에서 AI의 행동을 설명할 수 없다는 것을 발견했습니다. 때때로 AI는 단순한 패턴 매칭 기법처럼 행동했고, 다른 때에는 복잡한 확률 추적기처럼 행동했습니다. 이로써 용의자 목록은 세 가지 주요 전략 유형으로 좁혀졌습니다.
다음으로, 연구팀은 이론적인 질문을 던졌습니다. 트랜스포머(Transformer, 이 모델들이 사용하는 특정 AI 구조)가 실제로 이 세 가지 전략을 수행할 수 있는가? 그들은 수학적으로 그렇다는 것을 증명했습니다. 심지어 그들은 아주 작고 단순한 버전의 AI를 만들어 단 하나의 특정 날씨 패턴만을 학습시켰습니다. 이 작은 AI의 뇌를 들여다보았을 때, 그것은 자연스럽게 "유한 윈도우(finite-window)" 전략을 학습했음을 발견했습니다. 즉, 우주의 전체 역사를 기억하려 하기보다 최근 몇 가지 단서(예: 마지막 6개 또는 8개의 관측값)를 보고 추측하는 방식을 배운 것입니다.
하지만 진짜 마법은 이미 학습이 완료된 거대 AI 모델(우리에게 말을 걸 줄 아는 모델들)을 살펴보았을 때 일어났습니다. 그들은 **주성분 활성화 프로브(Principal Activations Probe, PAP)**라는 새로운 도구를 발명했습니다. AI의 뇌를 28개의 차선(레이어)이 있는 거대한 고속도로라고 상상해 보세요. PAP는 이 고속도로의 센서와 같습니다. 어떤 차선에서든 교통을 멈춰 세워 어떤 정보가 흐르고 있는지 확인하고, 심지 어려운 정보를 다른 시나리오의 정보와 교체하여 AI의 마음이 바뀌는지 확인할 수 있습니다.
그들이 발견한 것은 매혹적이면서도 다소 놀라운 것이었습니다. AI는 항상 한 가지 전략만을 사용하는 것이 아니라, 퍼즐의 난이도에 따라 내부 표현을 적응시킵니다.
- 쉬움 모드(Easy Mode): 날씨 단서가 매우 명확하고 지면의 변화가 예측 가능할 때(낮은 엔트로피), AI의 행동은 단순한 바이그램(Bigram) 통계와 일치합니다. 즉, 다음 것을 예측하기 위해 바로 직전에 본 것만을 효과적으로 살핍니다.
- 어려움 모드(Hard Mode): 단서가 노이즈가 많고 혼란스러울 때(높은 엔트로피), AI는 **소프트 n-그램(Soft n-gram)**이라 불리는 더 복잡한 전략에 의존합니다. AI는 최근 역사의 짧은 구간 동안 정보를 통합하여 "믿음(belief)"을 추적하기 시작합니다. 이는 땅이 젖어 있다는 사실뿐만 아니라 어제는 맑았다는 사실까지 기억하여 "구름 끼고 비 올 확률 있음"이라고 추측하는 것과 같습니다.
결정적으로, 연구진은 AI가 단순히 이러한 믿음을 저장하는 것이 아니라, 결정을 내리기 위해 실제로 이를 사용하고 있음을 증명했습니다. 그들은 AI의 뇌를 "패칭(patching)"함으로써 이를 수행했습니다. 즉, 어려운 퍼즐에서 얻은 "믿음"을 가져와서 AI가 쉬운 퍼즐을 풀고 있는 동안 그 뇌에 붙여넣었습니다. 그러자 AI의 예측은 즉시 어려운 퍼즐의 정답과 일치하도록 변했습니다. 이는 "믿음"이 단순한 부수적인 정보가 아니라, 예측을 이끄는 엔진임을 보여줍니다. 그러나 그들은 핵심적인 차이점도 발견했습니다. "어려움 모드"에서는 단순한 바이그램 전략이 초기 레이어에 존재하지만, 모델의 후속 연산 과정에서 효과적으로 **우회(bypassed)**됩니다. AI는 진정한 불확실성이 필요할 때만 단순한 패턴을 무시하고 더 풍부한 믿음 추적을 선택합니다.
하지만 또 다른 반전이 있었습니다. AI 뇌의 초기 레이어에서는 "믿음" 정보가 존재하고 읽기도 쉽지만, AI는 그것을 무시합니다! 이는 마치 대시보드에 지도가 있는데 창밖을 보며 운전하는 것과 같습니다. AI는 뇌의 후기 레이어에 도달해서야 비로소 그 지도를 사용하기 시작합니다. 이는 컴퓨터의 뇌 안에서 어떤 아이디어를 찾아낼 수 있다고 해서, 그것이 반드시 컴퓨터가 생각하는 데 그 아이디어를 사용하고 있다는 뜻은 아님을 의미합니다.
결론적으로, 이 논문은 거대한 AI들이 세상에 대한 복잡하고 완벽한 수학적 시뮬레이션을 실행하는 것이 아님을 시사합니다. 대신, 그들은 매우 효율적인 근사치 계산기(approximators)가 되는 법을 배웁니다. 그들은 인간이 그러하듯, 최근의 짧은 기록을 살펴보고 무엇이 일어나고 있는지에 대한 "믿음"을 업데이트하는 법을 배웁니다. 그들은 다음 단어나 다음 날씨 사건을 놀랍도록 잘 예측하기 위해 완벽한 통계학자가 될 필요는 없습니다. 그저 직전의 과거를 잘 추적하기만 하면 됩니다. 이 발견은 이러한 모델들의 "마법"이 사실은 패턴을 추적하는 매우 구조적이고 이해 가능한 과정임을 알려주며, 우리가 디지털 지능이 작동하는 방식을 진정으로 이해하는 데 한 걸음 더 다가가게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.