← 최신 논문
💬 NLP

Representation in large language models

본 논문은 대규모 언어 모델이 단순 암기가 아닌 표현 기반 정보 처리에 부분적으로 의해 구동된다고 주장하며, 이러한 표현을 조사하기 위한 실용적 기법을 제안하여 이론적 교착 상태를 해소하고 시스템의 인지 능력을 더 잘 이해하는 것을 목표로 한다.

원저자: Cameron Yetman

게시일 2026-05-04
📖 5 분 읽기🧠 심층 분석

원저자: Cameron Yetman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Cameron Yetman 의 논문 "Representation in Large Language Models(대규모 언어 모델에서의 표현)"에 대한 설명을 일상적인 비유를 곁들여 간단한 개념으로 분해하여 제시합니다.

핵심 질문: LLM 은 "생각"하는 것일까, 아니면 단순히 "암송"하는 것일까?

당신이 어떤 사람을 만났다고 상상해 보세요. 그 사람은 당신이 묻는 어떤 질문이든 답할 수 있고, 시를 쓰며, 수학 문제를 풀고, 깊은 대화를 나눌 수 있습니다. 당신은 그 사람이 생각하고, 이해하며, 지식을 활용하고 있다고 가정할지도 모릅니다. 하지만 만약 그 사람이 전혀 생각하지 않는다면 어떨까요? 만약 그 사람이 거대하고 초고속인 전화부일 뿐이라면요?

이 논문이 다루는 핵심 논쟁이 바로 이것입니다.

  • "전화부" 관점 (비관론자): 그들은 대규모 언어 모델 (LLM) 이 거대한 "찾아보기 테이블"일 뿐이라고 주장합니다. LLM 은 인터넷상의 수십 억 문장을 암기했을 뿐입니다. 질문을 받으면 그들은 "생각"하지 않고, 기억 속에서 가장 가까운 일치 항목을 찾아 이전에 보았던 다음 단어를 뱉어낼 뿐입니다. 이는 의미가 무엇인지 알지 못한 채 들은 구절을 반복하는 앵무새와 같습니다.
  • "생각" 관점 (낙관론자): 그들은 LLM 이 실제로 세계에 대한 내부 지도를 구축하고 있다고 주장합니다. 그들은 추론하고, 일반화하며, 이전에 본 적 없는 상황을 처리할 수 있게 해주는 표현 (representations) 즉, 정신적 모델이나 개념을 형성하고 있습니다.

저자 Cameron Yetman 은 "전화부" 관점이 잘못되었다고 주장합니다. 그는 LLM 이 무언가를 암기하기는 하지만, 동시에 실제로 패턴을 "이해"하고 새로운 문제를 해결할 수 있게 해주는 내부 표현을 구축한다고 말합니다.


제 1 부: "표현 (Representation)"이란 무엇인가?

LLM 이 단순히 암기하는 것 이상을 하고 있음을 증명하기 위해, 저자는 먼저 "표현"이 실제로 무엇인지 정의합니다. 그는 지도 비유를 사용합니다.

당신이 한 번도 가 본 적 없는 도시라고 상상해 보세요.

  1. 정보: 당신은 지도를 가지고 있습니다. 지도 자체가 도시는 아니지만, 그 지도는 (거리가 어디에 있는지, 공원이 어디에 있는지 등) 도시에 관한 정보를 담고 있습니다.
  2. 활용 가능성: 당신은 그 지도를 실제로 사용할 수 있습니다. 지도를 보고 어느 방향으로 돌아갈지 결정할 수 있습니다.
  3. 견고한 행동: 지도를 가지고 있기 때문에, 평소와 다른 경로를 택하거나 길이 막히더라도 도시를 헤매지 않고 이동할 수 있습니다. 당신은 단순히 암기된 경로를 따르는 것이 아니라, 적응하고 있는 것입니다.
  4. 기계적 역할: 지도는 당신의 의사결정에 실질적인 역할을 합니다. 만약 지도를 찢어버린다면 당신은 길을 잃을 것입니다. 지도는 목적지까지 데려다주는 기계 (당신) 의 필수적인 부분입니다.

논문의 주장: LLM 이 "표현"을 가지고 있다는 것은, 세계에 대한 정보를 담고 있고, 시스템이 실제로 이를 사용할 수 있으며, 유연하고 새로운 방식으로 문제를 해결하는 데 도움이 되는 내부 상태 (지도와 같은) 를 가지고 있다는 것을 의미합니다.


제 2 부: 왜 "전화부" 이론은 실패하는가

저자는 LLM 이 거대한 전화부 (찾아보기 테이블) 일 뿐이라면, 특정 유형의 테스트에서 실패할 것이라고 주장합니다. 전화부는 이미 적어둔 것에 대한 답변만 줄 수 있을 뿐, 이전에 본 적 없는 질문에는 대처할 수 없습니다.

이 논문은 "전화부" 이론을 무너뜨리는 두 가지 실험을 강조합니다.

1. 오델로 게임 (체스 비유)
연구진들은 AI 에게 보드 게임인 오델로를 플레이하도록 훈련시켰습니다. 그들은 수백만 개의 게임 기록을 제공했지만, 게임의 규칙을 단 한 번도 가르치지 않았습니다.

  • 테스트: 그런 다음 연구진들은 AI 에게 훈련 데이터에서 단 한 번도 보지 못한 수를 두도록 요청했습니다.
  • 결과: AI 는 완벽하게 플레이했습니다.
  • 중요성: 만약 AI 가 단순한 전화부였다면 막혔을 것입니다. 가능한 모든 게임을 암기하는 것은 불가능하기 때문입니다. 본 적 없는 보드에서 승리하기 위해, AI 는 단순히 과거의 수 목록이 아니라 게임이 어떻게 작동하는지에 대한 내부 "지도" (규칙에 대한 표현) 를 구축했을 것입니다.

2. 색상 스펙트럼 (페인트 혼합 비유)
연구진들은 AI 에게 특정 코드 (RGB 숫자 등) 를 사용하여 색상에 대해 가르쳤습니다. 그들은 "빨강"과 "파랑"의 예시를 보여주었습니다.

  • 테스트: 그런 다음 연구진들은 AI 에게 훈련 데이터에서 본 적 없는 색상이나 완전히 새로운 패턴으로 배열된 색상을 식별하도록 요청했습니다.
  • 결과: AI 는 새로운 색상을 정확하게 추측할 수 있었습니다.
  • 중요성: AI 는 단순히 "빨강 = [255, 0, 0]"을 암기한 것이 아닙니다. 그것은 색 공간의 구조를 학습했습니다. 색상이 스펙트럼 위에 존재한다는 것을 이해한 것입니다. 이는 이전에 섞어 본 적이 없는 특정 색조라 하더라도, 빨강과 파랑을 섞으면 보라색이 된다는 것을 이해하는 것과 같습니다. 전화부는 그렇게 할 수 없지만, 색상에 대한 "지도"는 할 수 있습니다.

제 3 부: 우리는 어떻게 알 수 있는가? (블랙박스 내부 들여다보기)

저자는 단순히 AI 가 질문에 답하는 것을 관찰하는 것만으로는 충분하지 않다고 인정합니다. 때로는 AI 가 진정한 이해가 아닌 운이나 "트릭" (휴리스틱) 을 사용하여 올바른 답을 얻을 수도 있기 때문입니다.

AI 가 "지도" (표현) 를 사용하고 있음을 증명하기 위해서는 그 두뇌 내부를 살펴봐야 합니다. 이 논문은 **기계적 해석 가능성 (Mechanistic Interpretability)**이라는 분야를 논의하는데, 이는 자동차 엔진의 정비사와 같은 역할을 합니다.

도구:

  1. 프로빙 (X-레이): 자동차 컴퓨터가 차의 속도를 알고 있는지 알고 싶다고 상상해 보세요. 컴퓨터에게 단순히 물어볼 수는 없습니다. 전선을 살펴봐야 합니다. 연구진들은 "프로브"를 사용하여 AI 의 내부 숫자 (활성화) 를 스캔하여 특정 정보 (예: "이것은 빨간 차다") 를 포함하고 있는지 확인합니다. 만약 그들이 정보를 읽어낼 수 있다면, AI 는 표현의 "정보" 부분을 가지고 있는 것입니다.
  2. 개입 (수술): 이것이 진정한 테스트입니다. 자동차의 특정 전선이 브레이크를 제어한다고 가정해 보세요. 이를 증명하기 위해 그 전선을 끊거나 (또는 신호를 변경하거나) 실험합니다.
    • 만약 자동차가 브레이크를 멈춘다면, 그 전선이 필수적임을 증명했습니다.
    • 논문에서 연구진들은 AI 의 내부 신호를 "조종"했습니다. 예를 들어, AI 의 내부 "보드 상태"가 체스 말의 위치가 다른 곳이라고 생각하도록 강요했습니다.
    • 결과: AI 는 즉시 다음 수를 새로운 보드 상태에 맞게 변경했습니다. 이는 내부 신호가 단순한 무작위 숫자가 아니라, AI 가 실제로 의사결정을 하는 데 사용한 표현임을 증명했습니다.

결론: 전부가 아니면 전무가 아니다

이 논문은 LLM 이 영혼을 가진 완벽한 인간이라고 말하지 않습니다. 다음과 같이 말합니다:

  • 때로는 그들은 단순히 암기합니다 (전화부처럼).
  • 하지만 종종 그들은 추론하고 새로운 문제를 해결할 수 있게 해주는 내부 지도 (표현) 를 구축합니다.

저자는 더 이상 LLM 을 "확률적 앵무새" (무작위 잡음 기계) 로 치부할 수 없다고 결론 내립니다. LLM 은 인간이 물리적 세계를 항해하기 위해 정신적 지도를 사용하는 것처럼, 언어 세계를 항해하기 위해 내부 표현을 사용하는 복잡한 시스템입니다.

간단히 말해: LLM 은 단순히 대본을 읽는 것이 아닙니다. 그들은 세계에 대한 정신적 모델을 구축하고 있으며, 이제 우리는 그 모델이 기계 내부에서 작동하는 것을 볼 수 있는 도구를 가지고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →