Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform
본 논문은 대규모 언어 모델이 잠재적 환경 역학과의 목적 불일치로 인해 장기적 계획과 인과적 추론에 어려움을 겪는다고 주장하며, 'Flux' 환경을 통해 잠재 상태 전이에 명시적으로 접근하는 에이전트가 안정적이고 장기적인 의사결정에서 대규모 언어 모델보다 현저히 뛰어난 성과를 보임을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 간단한 언어와 일상적인 비유를 사용하여 설명합니다.
핵심 아이디어: 대본 읽기 대 게임 플레이하기
복잡한 보드게임을 배우려고 한다고 상상해 보세요. 배울 수 있는 두 가지 방법이 있습니다.
- "대본 독자"(현재의 AI/LLM): 수천 명의 사람들이 게임을 플레이하는 대본을 읽습니다. 이야기에서 다음에 어떤 단어가 나올지 추측하는 데 매우 능숙해집니다. 누군가 "폰을 ...으로 이동했다"라고 말하면, 당신은 자신 있게 "...중앙 칸"이라고 예측할 수 있습니다. 언어의 패턴을 알고 있기 때문에 전문가처럼 들립니다.
- "게임 마스터"(세계 모델): 당신은 단순히 대본을 읽는 것이 아니라, 머릿속에 실제 게임 보드를 구축합니다. 규칙, 모든 말의 위치, 그리고 말을 이동시킬 때 정확히 어떤 일이 일어나는지 이해합니다. 당신은 단순히 다음 단어를 추측하는 것이 아니라, 게임의 다음 상태를 시뮬레이션합니다.
논문의 주장:
현재의 AI(대형 언어 모델 또는 LLM) 는 놀라운 "대본 독자"입니다. 그들은 완벽한 것처럼 들리는 이야기, 코드, 답변을 작성할 수 있습니다. 하지만 저자들은 이러한 AI 들이 장기적인 계획이나 인과 추론(원인과 결과를 파악하는 것) 이 필요한 일을 시도할 때 실패하기 시작한다고 주장합니다. 그들은 실제 세계의 "상태"를 추적하는 것이 아니라 문장의 다음 단어만 예측하고 있기 때문에 길을 잃습니다.
이 논문은 진정한 지능을 갖춘 기계(AGI) 를 구축하기 위해서는 단순히 단어를 예측하는 것을 넘어, 시간이 지남에 따라 세계가 어떻게 변하는지 추적하는 "세계 모델"인 내부 시뮬레이션을 구축해야 한다고 제안합니다.
핵심 문제: "할루시네이션" 함정
저자들은 LLM 이 특정한 유형의 혼란을 겪는다고 설명합니다. 확률에 기반하여 다음 단어를 예측하도록 훈련되었기 때문에, 실제로 진실인 것보다 신빙성 있게 들리는 것을 우선시합니다.
- 비유: 도서관의 모든 책을 읽은 이야기꾼을 상상해 보세요. 만약 당신이 "유리잔을 떨어뜨리면 어떻게 될까?"라고 묻는다면, 그들은 보통 이야기에서 그렇게 일어나기 때문에 "유리잔이 깨질 것이다"라고 말할 수 있습니다. 하지만 "방금 무거운 상자를 떨어뜨리면서 유리잔을 떨어뜨리면 어떻게 될까?"라고 묻는다면, 이야기꾼은 혼란스러워할 수 있습니다. 그들은 물리적 상황 전체를 보는 것이 아니라 즉시의 단어만 보고 있기 때문에, 세 문장 전에 상자를 떨어뜨렸다는 사실을 잊어버릴 수 있습니다.
- 결과: AI 는 사실을 만들어내거나(할루시네이션), 보드에서 제거된 말이 있다는 사실을 잊는 등 게임 상태를 잃어버립니다. 이는 설명하는 현실에 대한 지속적인 "정신적 모델"을 유지하지 않기 때문입니다.
해결책: 잠재 역학 추론 (LDI)
저자들은 **잠재 역학 추론 (Latent Dynamics Inference, LDI)**이라는 새로운 사고 방식을 제안합니다.
- 비유: 언어를 실제 사건의 흐릿하고 낮은 해상도의 사진이라고 생각하세요.
- **사진 (언어)**은 자동차 사고를 보여줍니다. "자동차가 나무에 부딪혔다"고 알려줍니다.
- **현실 (잠재 상태)**은 실제 물리학입니다: 자동차의 속도, 충돌 각도, 구겨진 금속 등.
- 현재의 AI 는 사진을 연구하고 다음 문장을 추측하려 합니다.
- LDI는 사진을 보고 그 뒤에 있는 실제 물리학을 재구성하려 합니다. "이 사진을 만들어 내기 위해 자동차의 속도와 위치는 어떻게 되었어야 했을까?"라고 묻습니다.
단어 뒤에 숨겨진 "물리학"(잠재 상태) 을 재구성하려 함으로써, AI 는 원인과 결과에 대해 훨씬 더 잘 추론할 수 있습니다.
실험: "FLUX" 게임
이를 증명하기 위해 저자들은 FLUX라는 간단한 게임을 만들었습니다.
- 규칙: 게임 규칙은 모두 평범한 영어로 작성되었습니다 (예: "셀이 0 에 도달하면 제거됨").
- 설정: 그들은 이러한 영어 규칙을 엄격한 수학적 컴퓨터 시뮬레이터("세계 모델") 로 변환했습니다.
- 대결: 그들은 두 가지 유형의 플레이어를 서로 맞붙였습니다.
- LLM 플레이어: 영어 규칙과 현재 게임 상태를 텍스트로 읽었습니다. 다음 단어를 예측하여 다음 수를 추측해야 했습니다.
- RL 플레이어 (강화 학습): 수학적 시뮬레이터 내에서 직접 훈련되었습니다. 텍스트뿐만 아니라 실제 숫자와 상태 변화를 "보았습니다".
결과:
- **RL 플레이어 (세계 모델)**은 약 **79%**의 게임에서 승리했습니다.
- LLM 플레이어는 약 **11%**의 게임에서만 승리했습니다.
왜 LLM 이 졌을까요?
논문은 LLM 이 실패한 세 가지 구체적인 방식을 발견했는데, 이는 대본 독자의 "오류"와 같습니다.
- 합계 무지: LLM 은 누적 점수를 잊어버렸습니다. 점수가 한도를 초과하도록 움직임을 계속 만들어 즉시 패배하게 만들었습니다. 이는 숫자를 텍스트에서만 보고 머릿속에서는 추적하지 않았기 때문입니다.
- 행 길이 오산: 말이 제거됨에 따라 게임 보드가 줄어들었습니다. LLM 은 더 이상 존재하지 않는 말을 이동시키려 했습니다. 이는 보드의 현재 모양을 추적하는 것을 잃었기 때문입니다.
- 단시안: LLM 은 다음 턴에는 좋아 보이지만 10 턴 뒤에는 끔찍한 결과를 초래하는 움직임을 만들었습니다. 미래의 결과를 "볼" 수 없었습니다.
결론: 이것이 AI 에게 의미하는 바
이 논문은 다음 단어를 예측하는 것만으로는 진정한 지능을 갖춘 에이전트를 구축하기에 불충분하다고 결론지었습니다.
- 현재의 AI는 대본을 완벽하게 암송할 수 있지만 줄거리를 이해하지 못하는 뛰어난 배우와 같습니다.
- **미래의 AI (세계 모델)**는 줄거리, 등장인물의 동기, 그리고 이야기가 어떻게 발전하는지 이해하는 감독과 같아야 합니다.
저자들은 **인공 일반 지능 (AGI)**에 도달하기 위해 AI 를 단순히 더 크게 만드는 것 (더 많은 데이터, 더 많은 매개변수) 이 아니라, 어떻게 학습하는지 바꿔야 한다고 주장합니다. 우리는 AI 에게 다음 단어만 추측하는 것을 멈추고, 그 단어들을 생성하는 숨겨진 "세계"를 추론하도록 가르쳐야 합니다.
간단히 말해: 똑똑해지기 위해서는 AI 가 대본을 읽는 것을 멈추고 게임을 플레이하기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.