← 최신 논문
🤖 machine learning

What does a Bayes-filtered transformer believe? A predictive Monte Carlo approach

이 논문은 베이즈 필터링된 트랜스포머(Bayes-filtered transformers)가 학습한 잠재 태스크(latent tasks)에 대한 암묵적 사전 분포와 사후 분포를 다음 토큰 생성만을 사용하여 직접적으로 근사함으로써, 취약한 예측 공간 비교의 한계를 극복하는 새로운 해석 가능성 방법론인 예측 몬테카를로(Predictive Monte Carlo, PMC)를 소개한다.

원저자: Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei

게시일 2026-07-21
📖 6 분 읽기🧠 심층 분석

원저자: Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 신비롭고 매우 똑똑한 로봇이 무엇을 생각하고 있는지 알아내려는 탐정이라고 상상해 보십시오. 당신은 로봇의 두뇌 내부를 들여다보거나 일기를 읽을 수 없으며, 오직 로봇이 "다음 단어 맞히기" 게임을 하는 것을 관찰할 수만 있습니다. 당신이 로봇에게 문장을 줄 때마다, 로봇은 놀라운 정확도로 다음 단어를 예측합니다. 하지만 이 퍼즐의 핵심은 이것입니다. 로봇이 훈련 과정에서 본 거대한 정답 목록을 단순히 암기하고 있는 것일까요, 아니면 새로운 상황에 대해 똑똑한 추측을 하기 위해 우주의 숨겨진 규칙을 실제로 학습하고 있는 것일까요? 이 질문은 머신러닝, 특히 맥락으로부터 AI가 어떻게 학습하는지를 연구하는 분야의 핵심에 자리 잡고 있습니다. 이를 이해하기 위해서는 "사전 확률(priors, 단서를 보기 전 로봇의 초기 추측)"과 "사후 확률(posteriors, 증거를 본 후 그 추측이 어떻게 변하는지)"에 대해 알아야 합니다. 과학자들은 이 로봇들이 진정으로 베이즈 추론(새로운 데이터에 기반하여 신념을 업데이트하는 세련된 방식)의 수학을 수행하고 있는 것인지, 아니면 단지 그 수학의 '겉모습'을 흉내 내고 있는 것인지 오랫동안 궁금해해 왔습니다.

이 논문은 커튼 뒤를 엿볼 수 있는 영리한 새로운 기술을 소개합니다. "베이즈 필터링 트랜스포머(숨겨진 규칙에 의해 생성된 시퀀스로 훈련된 유형의 AI)"를 다루는 연구진은 '예측 몬테카를로(Predictive Monte Carlo, PMC)'라고 불리는 방법을 개발했습니다. AI를 수백만 개의 수프 맛을 본 요리사라고 생각해 보십시오. 만약 당신이 요리사에게 레시피를 설명해 달라고 하면, 그는 그저 "치킨 맛이 납니다"라고 말할 수도 있습니다. 하지만 특정 재료를 주고 그 재료를 바탕으로 새로운 수프를 만들어 보라고 한 뒤, 그 새로운 수프를 맛보며 그가 정말로 생각하는 레시피가 무엇인지 알아내려 한다면, 당신은 그의 생각을 훨씬 더 명확하게 파악할 수 있습니다. 저자들은 이 "요리하기" 방법을 사용하여 AI로부터 수천 개의 가짜 미래 시퀀스를 생성합니다. 이 가짜 미래들을 분석함으로써, 그들은 AI의 숨겨진 "신념"을 재구성할 수 있습니다.

연구는 세 가지 다른 유형의 퍼즐을 대상으로 테스트되었습니다: 항아리에서 색깔 있는 공을 뽑는 게임, 선형 회귀 작업(흩어진 점들을 통과하는 선 찾기), 그리고 보드게임처럼 상태 사이를 이동하는 게임입니다. 각 경우에 대해, 연구진은 AI를 다양한 "작업(서로 다른 레시피)"의 혼합물로 훈련시켰고, 그 후 PMC를 사용하여 AI가 실제로 무엇을 믿고 있는지 확인했습니다. 그들은 AI의 내부 신념이 매혹적인 방식으로 변화한다는 것을 발견했습니다. AI가 몇 가지 유형의 작업에 대해서만 훈련될 때는 특정 사례를 엄격하게 고수하는 '암기자(memorizer)'처럼 행동합니다. 그러나 훈련되는 작업의 다양성이 증가함에 따라, AI는 모든 것에 적용되는 더 넓은 규칙을 학습하는 '일반화 도구(generalizer)'로 변화합니다. 흥iously하게도, 논문은 이 변화가 매끄럽게 일어나지 않는다는 것을 보여줍니다. 특정 지점에서 AI는 잠시 천재적인 일반화 도구처럼 행동하다가 다시 암기자 모드로 돌아갑ers. 결정적으로, 저자들은 AI의 최종 예측(단순히 "다음 단어 맞히기" 부분)만을 살펴보는 것으로는 이러한 현상을 볼 수 없다는 것을 입증했습니다. 서로 다른 두 가지 내부 신념 체계가 정확히 동일한 예측을 만들어낼 수 있기 때문에, 진짜 사고가 일어나는 곳인 '잠재 공간(latent space)'을 사용하지 않고서는 AI의 본질을 볼 수 없습니다.

탐정의 새로운 도구

그렇다면 이 새로운 도구인 PMC는 실제로 어떻게 작동할까요? AI를 특정 규칙에 따라 훈련받은 점술가라고 상상해 보십시오. 당신은 점술가에게 "하늘은 ~때문에 파랗다"와 같은 프롬프트를 줍니다. 그러면 점술가는 다음 단어들을 예측하기 시작할 것입니다. 보통, 당신은 그들의 첫 번째 예측만을 취하고 넘어갑니다. 하지만 PMC를 사용하면 거기서 멈추지 않습니다. 당신은 점술가에게 그 시작을 바탕으로 긴 이야기를 계속 만들어 가라고 요청합니다. 당신은 이를 수백 번 반복하여, 수백 개의 서로 다른 가능한 이야기들을 만들어냅니다.

이 긴 가짜 이야기들을 얻고 나면, 당신은 그 안의 패턴을 살펴봅니다. 만약 AI가 "하늘" 다음에 항상 "파랗다"가 오는 세상에서 훈련되었다면, 이야기들은 그것을 반영할 것입니다. 하지만 더 중요한 것은, 생성된 이야기의 전체를 분석함으로써 당신은 AI가 생각하는 "게임의 규칙"이 무엇인지 역설계할 수 있다는 점입니다. 이는 마치 마술사가 모자에서 토끼를 꺼내는 것을 지켜보는 것과 같습니다. 단순히 토끼를 보는 대신, 당신이 천 개의 서로 다른 모자에서 천 마리의 토끼를 꺼내는 것을 지켜봄으로써 그 모자가 어떻게 조작되었는지 정확히 알아내는 것과 같습니다. 이를 통해 연구자들은 AI의 "사전 확률(프롬프트를 받기 전 믿었던 것)"과 "사후 확률(프롬프트를 본 후 믿는 것)"을 지도화할 수 있습니다.

거대한 변화: 암기자 대 일반화 도구

연구진은 이 방법을 사용하여 AI에 대한 큰 질문을 테스트했습니다: 모델은 특정 사례를 암기하는 법을 배우는가, 아니면 규칙을 일반화하는 법을 배우는가? 그들은 세 가지 다른 "작업군(families of tasks)"을 설정했습니다.

첫째, **공과 항아리(Balls-and-Urns)**를 살펴보았습니다. 항아리에 빨간색과 파란색 공이 들어있다고 상상해 보십시오. AI의 임무는 다음 공을 맞히는 것입니다. 여기서 "작업"은 항아리 속의 빨간색과 파란색 공의 구체적인 혼합 비율입니다. 만약 AI가 몇 가지 특정 항아리에 대해서만 훈련된다면, 그것은 **암기자(Memorizer)**가 됩니다. "아, 이 특정 항아리에는 빨간 공이 80% 있으니 빨간색이라고 답해야지"라고 학습하는 것입니다. 하지만 AI가 다양한 혼합 비율을 가진 엄청나게 다양한 항아리들에 대해 훈련받는다면, 그것은 **일반화 도구(Generalizer)**가 됩니다. 즉, "공의 혼합은 무작위적이므로, 다음 것을 맞히기 위해 과거의 기록을 살펴봐야 한다"라는 규칙을 배우는 것입니다.

논문은 이 변화에 대한 "임계값(threshold)"을 발견했습니다. AI가 훈련받는 서로 다른 작업(서로 다른 항아리 혼합 비율)의 수가 적을 때, AI는 암기자처럼 행동합니다. 하지만 작업의 수가 늘어남에 따라, AI는 갑자기 일반화 도구처럼 행동하도록 전환됩니다. 이는 **작업 다양성 임계값(Task-Diversity Threshold)**이라 불리는 현상을 확인시켜 줍니다.

하지만 여기서 더욱 흥미로운 점이 있습니다. 연구진은 또한 **일시적 일반화(Transient Generalization)**를 관찰했습니다. 이것은 새로운 과목을 배우는 학생을 지켜보는 것과 같습니다. 처음에는 거시적인 관점(일반화)을 이해하려고 노력할 수 있지만, 그러다 혼란에 빠져 시험을 통과하기 위해 구체적인 사실들을 암기하기 시작할 수 있습니다. 논문은 훈련 과정 중에, 중간 정도의 작업 다양성 단계에서 AI가 실제로 일반화 도구로서 시작하지만, 훈련이 계속됨에 따라 다시 암기자로 흘러 들어간다는 것을 보여주었습니다. 이는 더 경직된 습관으로 자리 잡기 전의 일시적인 천재성의 단계입니다.

정답을 보는 것만으로는 충분하지 않은 이유

이 논문의 가장 중요한 발견 중 하나는 AI가 무엇을 하고 있는지 단지 그 답변을 보는 것만으로는 알 수 없다는 것입니다. 저자들은 훌륭한 비유를 사용합니다. 두 개의 서로 다른 도시 지도를 상상해 보십시오. 하나는 거리의 상세하고 정확한 그림입니다. 다른 하나는 주요 도로만을 보여주는 스케치입니다. 만약 당신이 두 지도 모두에 특정 커피숍으로 가는 길을 묻는다면, 그들은 정확히 동일한 경로를 알려줄 수도 있습니다. 만약 당신이 경로(예측)만을 본다면, 어떤 지도가 진짜인지 구분할 수 없습니다.

AI의 세계에서도 서로 다른 내부 "신념"(사후 확률)은 정확히 동일한 예측을 이끌어낼 수 있습니다. 논문은 AI의 예측을 "골드 스탠다드(기준)"와 비교하기만 했던 이전 연구들이 취약했던 이유가, 규칙을 진정으로 이해하는 모델과 단지 우연히 똑같은 것을 맞힌 모델을 구별할 수 없었기 때문이라고 주장합니다. PMC를 사용하여 "잠재 공간(latent space)" 내부를 들여다봄으로써, 연구진은 AI의 내부 지도가 실제로 암기자의 스케치에서 일반화 도구의 상세한 지도로, 그리고 다시 그 반대로 변화하고 있음을 볼 수 있었습니다.

수정구슬의 한계

저자들은 이 방법이 모든 것을 해결하는 마법 지팡이가 아님을 주의 깊게 언급합니다. PMC의 타당성은 수학적 조건이 충족되어야 한다는 점에 달려 있으며, 이는 실제 세계의 거대한 AI 모델에 대해서는 증명하기 어렵습니다. 실험에서 그들은 정답(ground truth)을 알고 있는 합성 작업(공과 항아리 또는 간단한 수학 문제 등)을 사용했습니다. 그들은 PMC가 그곳에서 아름답게 작동하여 AI의 숨겨진 신념을 성공적으로 복구해 냈음을 발견했습니다.

그러나 저자들은 실제 세계에서 사용되는 거대 AI 모델(에세이를 쓰거나 당신과 대화하는 모델들)에 대해서는 이 수학적 원리가 완벽하게 적용되는지 아직 알 수 없다고 인정합니다. AI의 내부 논리가 너무 복잡해서 우리의 "점술" 방법이 일부 미묘한 차이를 놓칠 수도 있습니다. 하지만 이러한 한계에도 불구하고, 이 논문은 AI를 조사할 수 있는 강력한 새로운 방법을 제공합니다. 이는 AI의 "만약에(what if)" 시나리오를 생성하고 분석함으로써, 우리가 이 모델들이 단순히 무엇을 말하고 있는지가 아니라, 실제로 무엇을 생각하고 있는지를 드디어 이해하기 시작할 수 있음을 시사합니다.

결국, 이 논문은 단순히 AI가 어떻게 학습하는지를 알려주는 데 그치지 않고, 학습 과정 자체를 바라보는 새로운 렌즈를 제공합니다. AI는 단순히 사실이 저장된 정적인 데이터베이스가 아니라, 암기와 이해 사이를 오가는 역동적인 시스템이며, 우리가 올바른 질문을 던지는 법을 안다면 이러한 변화를 추적할 수 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →