← 최신 논문
🤖 AI

Functional Subspace, where language models can use vector algebra to solve problems

본 논문은 대규모 언어 모델이 활성화 공간 내에서 기능적 부분 공간을 활용하며, 여기서 문맥 학습 작업은 증거를 누적하는 단순한 벡터 대수 연산을 통해 해결된다는 가설을 제시하고 이에 대한 증거를 제공합니다.

원저자: Jung H. Lee, Sujith Vijayan

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jung H. Lee, Sujith Vijayan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 을 인간의 말로 "생각하는" 거대하고 마법 같은 두뇌가 아니라, 모든 책이 하나의 정보 조각인 거대한 다층 도서관으로 상상해 보세요. 오랫동안 우리는 이 도서관이 책을 어떻게 정리하는지, 혹은 질문을 받았을 때 정답을 어떻게 찾는지 알지 못했습니다.

이 논문은 그 도서관을 바라보는 흥미진진한 새로운 방식을 제안합니다. 이 논문에 따르면 LLM 이 문제를 해결할 때 도서관 전체를 단순히 "읽는" 것이 아니라, 그 특정 작업만을 위해 기억 속에 특별하고 임시적인 방 (하위 공간, subspace) 을 구축한 뒤, 그 방 안에서 간단한 수학 (벡터 대수) 을 사용하여 문제를 해결합니다.

일상적인 비유를 통해 그들의 발견을 살펴보면 다음과 같습니다:

1. "맥락" 방 (In-Context Learning)

채팅에서 몇 가지 예시만 제공하면 컴퓨터에게 새로운 트릭을 가르칠 수 있다는 사실을 아시나요? 예를 들어, 다음과 같이 입력하면:

  • "뜨겁다 : 차갑다"
  • "빠르다 : 느리다"
  • "크다 : ?"

컴퓨터는 "작다"라고 추측합니다. 이를 맥락 학습 (In-Context Learning, ICL) 이라고 합니다. 이 논문은 묻습니다: 컴퓨터는 재학습 없이 어떻게 이를 파악할까요?

저자들은 컴퓨터가 이 특정 대화를 위해 전용 작업 공간 (하위 공간) 을 생성한다고 제안합니다. 마치 요리사가 샐러드를 주문하는 것을 보자마자 특정 도마를 비우고 스테이크와 수프는 무시한 채 샐러드 재료만 모으는 것과 같습니다. 컴퓨터는 거대한 지식의 나머지 부분에서 "샐러드" 논리를 분리해 냅니다.

2. "벡터 대수" 레시피

컴퓨터가 이 특별한 방에 들어오면, 인간의 의미로 단어를 "이해"할 필요가 없습니다. 대신 단어를 특정 방향을 가리키는 화살표 (벡터) 로 취급합니다.

  • 비유: "행복"이 북쪽을 가리키는 화살표이고, "슬픔"이 남쪽을 가리키는 화살표라고 상상해 보세요.
  • 수학: 컴퓨터가 "행복 : 슬픔" 패턴을 보면, 정답을 얻으려면 화살표를 180 도 뒤집으라는 규칙을 학습합니다.
  • 결과: "빠르다 : ?"라고 질문하면 컴퓨터는 "빠르다" 화살표를 가져와서 (반의어 규칙에 따라) 뒤집어 "느리다"에 도달합니다.

이 논문은 이러한 작업에서 컴퓨터는 본질적으로 이러한 화살표에 대한 덧셈과 뺄셈을 수행한다고 주장합니다. 깊이 "생각"하는 것이 아니라 단순한 기하학적 계산을 수행하는 것입니다.

3. 도서관이 방을 구축하는 방법

이 논문은 컴퓨터가 모델 내부의 두 가지 주요 도구를 사용하여 어떻게 이 방을 구축하는지 설명합니다:

  • "메모리 스택" (Feed-Forward Networks): 이들은 파일 캐비닛처럼 작동합니다. 컴퓨터가 단어를 보면 그 단어와 연관된 가능한 답변 목록을 꺼냅니다. "런던"이라고 말하면 캐비닛은 "영국 수도", "금융 허브", "비 오는 도시" 등을 꺼낼 수 있습니다.
  • "스포트라이트" (Self-Attention): 이는 어떤 파일을 사용할지 결정하는 부분입니다. 프롬프트가 지리에 관한 것이라면 스포트라이트는 "수도" 파일에 비추고, 금융에 관한 것이라면 "허브" 파일에 비춥니다.

저자들은 컴퓨터가 예시 ("뜨겁다 : 차갑다" 쌍) 를 처리함에 따라 이 특별한 방에 증거를 누적시킨다고 발견했습니다. 블록을 쌓는 것과 같습니다: 모든 예시가 "반의어" 더미에 블록을 하나씩 추가합니다. 마지막 질문에 도달할 때쯤이면 그 더미가 충분히 높아져 정답을 예측할 수 있습니다.

4. 하위 공간의 "마법"

연구진들은 모델의 계층을 통해 흐르는 데이터인 내부 "잔류 스트림 (residual streams)"을 살펴봄으로써 이를 테스트했습니다. 그들은 데이터가 이동하는 "주요 방향"을 찾기 위해 PCA(주성분 분석) 라는 통계 도구를 사용했습니다.

그들이 발견한 것:

  • 컴퓨터는 자연스럽게 이러한 저차원 방 (하위 공간) 을 생성합니다.
  • 이러한 방에서 질문과 답변 사이의 관계는 거의 완벽하게 선형입니다 (직선과 같음).
  • 컴퓨터가 정답을 맞히면 이 방의 수학은 한 가지 방식으로 보이고, 틀리면 수학은 다르게 보입니다. 이는 컴퓨터가 실제로 결정을 내리기 위해 이 특정 "방"과 "수학"을 사용하고 있음을 증명합니다.

요약

이 논문은 대형 언어 모델이 단순히 패턴에 기반해 추측하는 것이 아니라고 주장합니다. 대신, 몇 가지 예시를 제공받으면 다음과 같이 행동합니다:

  1. 기억 속에 임시적이고 전문화된 방을 구축합니다.
  2. 단어를 화살표 (벡터) 로 변환합니다.
  3. 그 방 안에서 간단한 수학 (화살표 더하기 또는 빼기 등) 을 사용하여 정답을 찾습니다.

이는 AI 의 "발현 능력" (즉시 새로운 기술을 습득하는 것처럼 보이는 현상) 이 실제로는 모델이 현재 해결해야 할 퍼즐을 풀기 위해 기존 지식을 이러한 깔끔한 수학 하위 공간으로 조직화하는 것에 불과함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →