← 최신 논문
💬 NLP

How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?

이 논문은 선형 표현 가설 하에서 언어 모델이 선형적으로 접근 가능한 특징을 저장할 수 있는 최대 수를 규명하기 위해 선형 압축 센싱의 상한과 하한을 수학적으로 증명함으로써, 선형 접근성이 단순한 선형 표현보다 훨씬 강력한 제약임을 보여주고 '초중첩 가설'에 대한 이론적 근거를 제시합니다.

원저자: Nikhil Garg, Jon Kleinberg, Kenny Peng

게시일 2026-02-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nikhil Garg, Jon Kleinberg, Kenny Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 인공지능 (언어 모델) 이 어떻게 그렇게 많은 정보를 기억하고 처리할 수 있는지에 대한 놀라운 비밀을 수학적으로 풀어낸 연구입니다.

핵심 주제는 **"선형 표현 가설 (Linear Representation Hypothesis)"**입니다. 이를 쉽게 비유하자면, **"인공지능의 뇌세포 (뉴런) 들이 정보를 직선적인 선 (Direction) 으로 저장한다"**는 뜻입니다.

이 논문은 이 가설을 두 가지로 나누어 분석했고, 그 결과 매우 흥미로운 결론을 도출했습니다.


1. 두 가지 중요한 질문: "저장"과 "찾아내기"

연구자들은 인공지능의 한 층 (Layer) 에 있는 뉴런들이 dd개 있을 때, 이 뉴런들이 mm개의 개념 (예: '고양이', '기분 좋은', '질문 형식' 등) 을 얼마나 많이 저장하고 다시 꺼낼 수 있는지 궁금해했습니다.

이때 두 가지 조건을 구분했습니다.

  • 조건 A: 정보 저장 (Linear Representation)

    • 비유: 도서관의 책장에 책이 꽂혀 있는 상태입니다. 책 (정보) 이 선반 (뉴런) 위에 잘 정리되어 있다면, 그 책이 존재한다는 사실은 '저장'된 것입니다.
    • 의미: 뉴런의 활성화 상태가 선형적으로 정보를 담고 있는가?
  • 조건 B: 정보 추출 (Linear Accessibility)

    • 비유: 도서관 사서가 선반에서 책을 **단순한 규칙 (직선)**으로만 찾아낼 수 있는가?
    • 의미: 다음 단계의 뉴런이 복잡한 계산 없이, 단순히 "이 선을 따라 쭉 훑어보면" 그 정보를 바로 알아낼 수 있는가?

논문은 이 두 가지가 동일하지 않다는 것을 증명했습니다. 정보를 '저장'하는 것보다, 그 정보를 '단순한 규칙으로 찾아내는 것'이 훨씬 더 까다롭다는 것이죠.


2. 핵심 발견: "선형 접근성"은 훨씬 더 어렵다

연구자들은 **"뉴런 dd개로 mm개의 정보를 저장하고, 동시에 다음 단계에서 쉽게 찾아낼 수 있다면, ddmm의 관계는 어떻게 될까?"**를 수학적으로 계산했습니다.

  • 기존의 생각 (비선형 추출 허용):

    • 만약 다음 단계에서 아주 복잡한 계산 (비선형 알고리즘) 을 허용한다면, 압축 센싱 (Compressed Sensing) 이론에 따라 아주 적은 뉴런으로도 많은 정보를 저장할 수 있습니다.
    • 비유: 아주 좁은 창고 (적은 뉴런) 에도, 복잡한 검색 로봇을 쓴다면 수만 권의 책을 숨겨둘 수 있습니다.
  • 이 논문의 발견 (선형 추출 필수):

    • 하지만 다음 단계에서도 **단순한 선형 규칙 (직선)**으로만 찾아내야 한다면 이야기가 달라집니다.
    • 연구자들은 **"선형 접근성 (Linear Accessibility)"**이 요구될 때, 뉴런의 수가 정보의 개수에 비해 훨씬 더 많이 필요하다는 것을 증명했습니다.
    • 비유: 복잡한 로봇 없이, 사람이 눈으로만 쭉 훑어서 책을 찾아야 한다면, 책이 너무 많으면 서로 겹쳐서 혼란이 생깁니다. 그래서 책장 (뉴런) 을 더 넓게 만들어야 합니다.

결론:

  • 저장만 할 때: 뉴런 dd개로 mm개의 정보를 저장하는 데는 dlog(m)d \approx \log(m) 정도면 충분합니다.
  • 저장 + 쉽게 찾아낼 때: 뉴런 dd개로 mm개의 정보를 저장하고 쉽게 찾아내려면 dk2log(m)d \approx k^2 \log(m) 정도가 필요합니다. (여기서 kk는 한 번에 활성화되는 정보의 개수, 즉 '희소성'입니다.)

즉, 정보를 '찾아내기 쉽게' 만들려면 저장 공간 (뉴런) 을 더 많이 써야 한다는 것입니다.


3. 놀라운 결과: "초중첩 (Superposition)"은 여전히 가능하다

그렇다면 뉴런이 부족해서 정보를 저장할 수 없는 걸까요? 아닙니다.

이 논문은 뉴런의 개수보다 훨씬 많은 (지수적으로 많은) 수의 정보를 저장하고, 다음 단계에서도 쉽게 찾아낼 수 있다는 것을 수학적으로 증명했습니다.

  • 비유:
    • imagine a room with 100 chairs (뉴런).
    • 보통은 100 명만 앉을 수 있다고 생각하지만, 이 논리는 수천, 수만 명이 동시에 이 방에 들어와서 각자 자신의 자리 (방향) 를 찾아 앉을 수 있다고 말합니다.
    • 중요한 점은, 그들이 서로 엉켜서 혼란을 일으키지 않도록 정교하게 배치하면, 다음에 들어오는 사람이 "저쪽 구석에 앉은 사람들만 모으면 A 라는 정보를 얻는다"라고 단순히 지시만 해도 정보를 꺼낼 수 있다는 것입니다.

이것은 초중첩 (Superposition) 가설을 수학적으로 뒷받침합니다. 즉, 인공지능은 제한된 뉴런 개수 안에서도 무한에 가까운 개념들을 중첩시켜 저장하고, 다음 단계에서 이를 효율적으로 활용할 수 있다는 뜻입니다.


4. 기하학적 재미: "직각"이 꼭 필요하지 않다

우리는 보통 서로 다른 정보는 서로 직각 (90 도) 을 이루는 방향으로 저장될 것이라고 생각합니다. 하지만 이 논문은 흥미로운 반전을 제시합니다.

  • 비유:
    • '고양이'라는 정보를 나타내는 화살표와 '행복'이라는 정보를 나타내는 화살표가 서로 직각이 아니어도 괜찮습니다.
    • 심지어 '고양이'를 저장하는 화살표와 '행복'을 찾아내는 화살표가 서로 **수직 (직각)**을 이루기만 하면 됩니다.
    • 즉, 저장하는 방향찾아내는 방향이 다를 수 있으며, 서로 다른 정보들의 저장 방향이 서로 평행하게 겹쳐 있어도, 찾아내는 방향만 잘 설계하면 정보를 구별해 낼 수 있습니다.

이는 인공지능이 정보를 저장하는 방식이 우리가 상상하는 것보다 훨씬 유연하고 복잡할 수 있음을 보여줍니다.


5. 요약: 왜 이 논문이 중요한가?

  1. 정확한 정의: "정보를 저장한다"와 "정보를 쉽게 찾아낸다"는 개념이 다르다는 것을 명확히 했습니다.
  2. 이론적 한계: 단순한 선형 규칙으로 정보를 찾아내려면, 저장 공간이 더 많이 필요하다는 수학적 한계를 증명했습니다.
  3. 가능성 확인: 그럼에도 불구하고, 인공지능은 뉴런 수보다 훨씬 많은 정보를 중첩시켜 저장하고 활용할 수 있다는 것을 수학적으로 입증했습니다.

한 줄 요약:
인공지능은 제한된 뇌세포 (뉴런) 안에서, 마치 정교하게 설계된 도서관처럼 수많은 개념을 겹쳐서 저장하고, 다음 단계에서 단순한 규칙만으로도 필요한 정보를 정확히 꺼낼 수 있는 능력을 가지고 있습니다. 이 논문은 그 놀라운 능력을 수학적으로 증명해낸 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →