← 최신 논문
📊 statistics

Transformers Can Learn Posterior Predictive Distributions In-Context

본 논문은 트랜스포머가 가우시안 프로세스 회귀를 위한 경사 하강 알고리즘을 구현함으로써 컨텍스트 내에서 사후 예측 분포를 근사할 수 있음을 이론적으로 증명하고, 정규화 및 어텐션 깊이와 같은 아키텍처 선택이 그들의 외삽 능력과 오차 한계에 미치는 영향을 분석한다.

원저자: Gyeonghun Kang, Changwoo J. Lee, Xiang Cheng

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gyeonghun Kang, Changwoo J. Lee, Xiang Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 특정 시험을 한 번도 받아본 적 없지만 모든 가능한 주제를 다루는 수백만 개의 모의고사를 읽은 초지능 학생 (Transformer) 이 있다고 가정해 봅시다. 여러분이 이 학생에게 새로운 짧은 모의고사 세트 (context) 를 주고 마지막 문제의 정답을 예측하도록 요청하면, 그들은 단순히 추측하지 않습니다. 그들은 머릿속에서 모의고사 문제들의 패턴을 즉시 "다시 읽으며" 가장 그럴듯한 정답과 그 정답에 대한 자신감 수준을 파악해냅니다.

이 논문은 바로 **가우시안 프로세스 회귀 (Gaussian Process Regression)**라는 문제 유형 (흩어진 점들을 기반으로 매끄러운 곡선을 예측하는 것) 에 대해, 이 학생이 머릿속에서 실제로 그 수학을 어떻게 수행하는지를 증명하는 것입니다.

다음은 간단한 비유를 사용한 그들의 발견 내용입니다:

1. 목표: 한 점 (Dot) 이 아닌 전체 그림 예측하기

일반적으로 AI 모델은 "이 집은 50 만 달러에 팔릴 것이다"와 같이 하나의 숫자 (점 예측) 만 제공합니다.
하지만 이 논문은 **Prior-Data Fitted Networks(PFNs)**에 초점을 맞춥니다. 이러한 모델은 불확실성의 전체 그림을 제공한다는 점에서 특별합니다. 하나의 숫자 대신 "이 집은 아마도 50 만 달러에 팔리겠지만, 45 만 달러 미만일 확률은 5% 이고 55 만 달러 미만일 확률은 95% 입니다"라고 말합니다. 이를 **사후 예측 분포 (Posterior Predictive Distribution, PPD)**라고 합니다.

저자들은 궁금해했습니다: Transformer 는 어떻게 소수의 예시만 보고도 이런 복잡한 '전체 그림'을 실제로 계산할 수 있을까요?

2. 비밀 무기: '반복 솔버 (Iterative Solver)'

이 논문은 Transformer 가 단순히 추측하는 것이 아니라, 등산가가 정상에 도달하기 위해 천천히 언덕을 오르는 것과 유사하게 내부 레이어에서 수학적 알고리즘을 은밀히 실행하고 있음을 밝힙니다.

  • 비유: 땅에 그려진 원의 정확한 중심을 찾으려 하지만 작은 발걸음만 낼 수 있다고 상상해 보세요.
  • Transformer 의 수행 방식: Transformer 의 '어텐션 (Attention)' 레이어들은 단계별 계산기처럼 작동합니다. 네트워크의 각 레이어 (등산가가 취하는 각 발걸음) 마다 실제 수학적 정답에 더 가까워집니다.
    • 레이어 1: 대략적인 추측을 합니다.
    • 레이어 2: 이전 추측을 바탕으로 추측을 수정합니다.
    • 레이어 3: 다시 정교하게 다듬습니다.
    • 결과: 데이터가 네트워크의 끝까지 도달할 때쯤이면, 데이터의 **평균 (mean)**과 **분산 (variance)**을 완벽하게 계산하기에 충분한 '단계'를 거친 상태가 됩니다.

3. 숫자를 지도로 바꾸기 ('Binning' 트릭)

Transformer 가 평균과 분산을 계산한 후, 이 숫자들을 앞서 언급한 '전체 그림'인 확률 지도로 변환해야 합니다.

  • 비유: 매끄러운 연속적인 언덕 (확률 곡선) 이 있다고 가정해 보세요. 이를 픽셀화된 화면에 그리려면 언덕을 작은 정사각형 블록 (bins) 들로 잘라야 합니다.
  • 논문의 주장: Transformer 의 마지막 부분 (작은 'MLP' 헤드) 은 픽셀화 장치처럼 작동합니다. 계산된 평균과 분산을 가져와 이 작은 블록들을 채워 확률의 단계별 지도를 생성합니다. 논문은 블록 (bins) 과 단계 (레이어) 가 충분히 많다면, 이 픽셀화된 지도가 완벽한 매끄러운 곡선과 거의 동일하게 보인다고 증명합니다.

4. 성공을 위한 두 가지 큰 규칙

저자들은 이 '학생'이 훈련된 것보다 더 크고 새로운 문제를 처리할 수 있는지 여부를 결정하는 두 가지 중요한 사실을 발견했습니다:

규칙 A: 정규화 (Normalization) 는 안전벨트입니다

  • 문제: 작은 데이터셋 (예: 100 개 예시) 으로 모델을 훈련시킨 후 1,000 개 예시와 같은 거대한 데이터셋을 풀도록 요청하면, '단계' 내부의 수학이 엉망이 될 수 있습니다. 속도 조절기가 없는 상태로 고속도로에서 200 마일로 작은 마을용 자동차를 운전하려는 것과 같습니다; 엔진이 폭발합니다.
  • 해결책: 논문은 정규화 (네트워크 내부 데이터를 스케일링하는 특정 방식) 가 속도 조절기처럼 작용한다고 보여줍니다. 이는 '단계'를 안정적으로 유지시켜 훈련 중보다 훨씬 큰 데이터셋에도 일반화할 수 있게 합니다. 이것이 없으면 데이터가 커지면 모델은 완전히 실패합니다.

규칙 B: 깊이 (Depth) 는 사다리입니다

  • 문제: 데이터셋이 커질수록 수학이 풀기 어려워집니다. '언덕'이 더 가파해집니다.
  • 해결책: 그 언덕을 오르기 위해서는 더 많은 레이어 (더 많은 단계) 가 필요합니다. 논문은 데이터셋이 10 배 커지면 동일한 정확도를 얻기 위해 약 10 배 더 많은 레이어가 필요함을 증명합니다. 레이어를 추가하지 않으면 모델은 올바른 정답에 수렴하는 것을 멈춥니다.

5. 실제로 테스트한 내용

저자들은 단순히 종이 위에서 수학을 한 것이 아니라, '장난감' Transformer 를 구축하여 테스트했습니다:

  • 테스트: 작은 데이터셋으로 모델을 훈련시킨 후 거대한 데이터셋을 던져주었습니다.
  • 결과:
    • 정규화가 없는 모델은 데이터가 커지면 붕괴되었습니다.
    • 정규화가 있는 모델은 완벽하게 작동했습니다.
    • 레이어가 더 많은 모델은 특히 더 어렵고 큰 문제에서 더 정확했습니다.
    • 그들은 심지어 사크라멘토의 집값과 워커 호의 광물 등급과 같은 실제 세계 데이터에서도 테스트하여, Transformer 의 예측이 통계학자들이 사용하는 금표준 수학적 방법과 거의 동일하게 보임을 발견했습니다.

요약

이 논문은 Transformer 가 마법의 블랙박스가 아님을 증명합니다. 그들이 '컨텍스트 내에서' 확률을 예측하는 법을 배울 때, 실제로는 데이터의 평균과 분산을 찾기 위해 (등산가가 언덕을 오르는 것과 같은) 구체적인 단계별 수학적 계산을 수행하고 있습니다. 이를 실제 세계의 큰 문제에 적용하려면 두 가지가 필요합니다: 수학을 안정적으로 유지하는 정규화와 더 어려운 퍼즐을 풀기에 충분한 단계를 모델에 제공하는 깊이 (더 많은 레이어).

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →