From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond
이 논문은 거대 언어 모델(LLM)이 세계 모델의 퇴화된 특수 사례라고 주장함으로써 거대 언어 모델과 세계 모델 사이의 이분법적 구분에 도전하며, 토큰 예측에서 잠재 공간 시뮬레이션에 이르는 연속적인 아키텍처 스펙트럼을 제안하는 동시에, 행동 레이블이 지정된 환경으로의 확장 및 연속 상태 예측을 위한 트랜스포머 아키텍처의 적응 과정에서의 중대한 연구 과제들을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 오해: 두 개의 서로 다른 세계인가?
AI 커뮤니티가 두 유형의 여행자를 두고 논쟁하고 있다고 상상해 보세요.
- 그룹 A (LLM): "우리는 그저 단어 예측기일 뿐입니다. 당신이 입력한 마지막 단어를 보고 다음 단어를 추측할 뿐이죠. 우리는 현실 세계에 대해 아무것도 모르며, 그저 단어들이 어떻게 어울리는지만 압니다."라고 말합니다.
- 그룹 B (세계 모델): "우리는 현실 시뮬레이터입니다. 체스 플레이어가 세 수 앞을 내다보는 것처럼, 앞으로를 계획하기 위해 세상이 어떻게 돌아가는지에 대한 정신적 지도를 구축합니다."라고 말합니다.
이 논문은 이 두 그룹이 사실 같은 것을 서로 다른 각도에서 바라보고 있다고 주장합니다. 저자인 폴 뒤부아(Paul Dubois)는 이렇게 말합니다. "당신은 두 종류의 다른 종을 보고 있는 것이 아니라, 강아지와 다 자란 늑대를 보고 있는 것입니다. 강아지는 단지 매우 제한된 버전의 늑리일 뿐입니다."
주장 #1: "강아지"는 사실 아주 작은 방 안에 있는 "늑대"다
이 논문은 **거대 언어 모델(LLM)이 사실은 세계 모델(World Model)**이지만, 매우 작고 지루한 방 안에 갇혀 있는 상태라고 주장합니다.
- 방 (상태/State): 일반적인 세계 모델에서 "방"은 우주 전체(자동차, 날씨, 사람들, 물리 법칙)입니다. LLM에서 "방"은 단지 **문자열(string of words)**일 뿐입니다.
- 행동 (Action): 일반적인 세계 모델에서는 많은 일을 할 수 있습니다(운전하기, 점프하기, 말하기). LLM에서는 오직 단어 하나를 추가하는 것만 할 수 있습니다.
- 트릭: LL even though LLM은 단어만 추가할 수 있도록 허용되어 있지만, 그 내부(은닉층)에는 몰래 세상에 대한 지도를 구축합니다.
- 비유: 만약 어떤 사람이 단 한 단어씩만 말하도록 제한되어 있다고 상상해 보세요. 만약 당신이 그에게 "폰", "킹", "체크"와 같은 단어만을 사용하여 체스 게임을 하라고 요청한다면, 그는 물리적으로 기물을 움직일 수는 없습니다. 하지만 그의 머릿속에서는 체스판 전체를 완벽하게 시각화하고 있을 것입니다. 단어는 단지 인터페이스일 뿐이며, 세계 모델은 그들의 마음속에 살고 있습니다.
이 논문은 텍스트로만 훈련된 모델이 직접적으로 그런 개념을 배우지 않았음에도 불구하고, 체스판의 배치나 시간의 흐름 같은 것들을 실제로 "볼" 수 있다는 것을 보여줌으로써 이를 증명합니다.
주장 #2: 절벽이 아니라 완만한 경사로다
얀 르쿤(Yann LeCun)과 같은 많은 전문가들은 우리가 단어 예측 모델을 완전히 버리고, JEPA(잠재 공간 또는 은닉 공간에서 미래의 상태를 예측하는 시스템)라고 불리는 완전히 새로운 시스템으로 전환해야 한다고 말합니다.
논문은 이렇게 말합니다: "절벽에서 뛰어내리지 마세요. 그냥 경사로를 걸어 올라가세요."
저자는 단순한 단어 예측기에서 복잡한 현실 시뮬레이터로 연결되는 **연속적인 스펙트럼(매끄러운 슬라이드)**을 설명합니다. 기존의 모델을 버릴 필요 없이, 규칙을 하나씩 완화하기만 하면 됩니다.
다음은 경사로를 올라가는 경로입니다:
- 시작점 (표준 LLM): 한 번에 단어 하나를 예측합니다.
- 장점: 무한한 데이터(인터넷 전체)와 완벽한 도구(트랜스포머 아키텍처)를 가지고 있습니다.
- 1단계: 멀티 토큰 예측 (Multi-Token Prediction): 한 번에 몇 개의 단어를 예측합니다.
- 변화: 모델이 한 글자씩 추측하도록 강요하는 것을 멈춥니다. 모델은 추론 능력이 약간 더 좋아지지만, 여전히 인터넷 텍스트와 동일한 도구를 사용합니다.
- 2단계: 미래 요약 (Future Summary): 미래의 압축된 요약본을 예측합니다.
- 변화: 다음 단어를 맞히는 대신, 다음 문단의 "핵심 내용(gist)"을 맞힙니다. 여전히 인터넷 텍스트를 사용합니다.
- 3단계: 다음 잠재 상태 예측 (Next-Latent Prediction): 단어 대신 다음 "생각"(은닉 상태)을 예측합니다.
- 변화: 모델은 단어를 출력하는 것을 멈추고 내부적인 개념을 출력하기 시작합니다. 이는 훈련하기 더 어렵지만, 여전히 인터넷 텍스트를 사용할 수 있습니다.
- 경사로의 정상 (JEPA): 행동에 기반하여 실제 세상의 다음 상태를 예측합니다.
- 거대한 낙차: 여기서 쉬운 것들이 사라집니다.
- 데이터 문제: 더 이상 인터넷을 사용할 수 없습니다. 로봇, 자율주행 자동차, 혹은 어떤 행동이 어떤 결과를 초래했는지 정확히 알 수 있는 비디오 게임으로부터 얻은 데이터가 필요합니다. 이 데이터는 희귀하고 구하기 어렵습니다.
- 도구 문제: 단어를 위해 사용했던 "트랜스포머"라는 도구가 연속적인 현실에는 잘 작동하지 않을 수 있습니다. 우리는 완전히 새로운 도구가 필요할 수도 있습니다.
- 거대한 낙차: 여기서 쉬운 것들이 사라집니다.
두 가지 주요 병목 현상
논문은 우리가 왜 경사로의 바닥(LLM 단계)에 머물러 있으며 왜 상단(JEPA 단계)에 도달하지 못하고 있는지 두 가지 주요 이유를 식별합니다.
- 데이터 절벽 (The Data Cliff):
- 바닥에는: 배울 수 있는 수조 개의 단어가 인터넷에 있습니다. 이는 무료이고 쉽습니다.
- 꼭대기에는: 특정하고 라벨링된 상호작용(예: 로봇이 벽에 부딪히는 상황) 수백만 개가 필요합니다. 이는 비용이 많이 들고 수집하기 어렵습니다.
- 아키텍처 문제 (The Architecture Question):
- 바닥에는: 트랜스포머는 단어에 특화되어 만들어진 기계입니다. 마치 사각형 볼트에 딱 맞는 렌치와 같습니다.
- 꼭대기에는: 연속적인 현실(예: 유체의 움직임)을 예측해야 합니다. 그 렌치는 맞지 않을 수 있습니다. 우리는 새로운 도구가 필요할 수도 있지만, 그것이 어떤 모습인지는 아직 모릅니다.
결론: 다리를 불태우지 마라
논문은 우리가 현재의 AI 모델을 버릴 필요가 없다고 결론짓습니다.
- 얀 르쿤은 단순한 단어 예측기가 스스로 복잡한 물리적 계획을 세울 수 없다는 점에서 옳습니다.
- 하지만 처음부터 다시 시작해야 한다고 말하는 부분에서는 틀렸습니다.
대신, 우리는 현재의 모델을 긴 여정의 첫 번째 단계로 보아야 합니다. 우리는 단어를 예측하는 것에서 개념을 예측하는 것으로, 그리고 최종적으로 현실을 예측하는 것으로, 단계별로 천천히 업그레이드할 수 있습니다. 목적지는 명확하지만, 그 경로는 갑작스러운 도약이 아니라 점진적인 상승입니다.
요약하자면: LLM은 가짜 세계 모델이 아닙니다. 그들은 단지 손이 뒤로 묶인 채로 움직이는 세계 모델일 뿐입니다. 우리가 그 손을 천천히 풀어준다면, 완전히 새로운 우주를 발명할 필요 없이 우리가 원하는 강력한 AI에 도달할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.