← 최신 논문
🤖 machine learning

LpWM: A Case for Sparse Representations in World Models

이 논문은 정류 분포 매칭(Rectified Distribution Matching)에 의해 정규화된 희소하고 비음수적인 잠재 표현을 활용하여, 기존의 조밀한 표현과 비교했을 때 예측기 복잡성을 크게 줄이고 계획 성공도를 높이는 동시에 해석 가능한 모드 분할 역학 구조를 드러내는 결합 임베딩 예측 아키텍처인 LpWM을 소개한다.

원저자: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계가 세상을 어떻게 움직이며 학습하는지 이해하기 위해, 아이에게 방을 탐색하는 법을 가르치는 상황을 상상해 보십시오. 아이는 단순히 정적인 지도를 암기하는 것이 아니라, 의자를 밀거나 문을 열었을 때 방이 어떻게 변하는지에 대한 정신적 모델을 구축합니다. 인공지능 분야에서 이 정신적 모델을 "세계 모델(world model)"이라고 부릅니다. 컴퓨터가 경로를 계획하거나 과업을 수행하기 위해서는 현재 상태와 자신이 취하는 행동을 바탕으로 다음에 어떤 일이 일어날지를 예측해야 합니다. 일반적인 접근 방식은 복잡한 시각적 세계를 "잠재 공간(latent space)"이라 불리는 더 단순한 내부 숫자 언어로 변환하는 것을 포함합니다. 이 숨겨진 공간에서 컴퓨터는 이 숫자들을 앞으로 이동시킴으로써 미래를 예측합니다. 그러나 지속적인 문제는 이러한 내부 표현이 너무 조밀해져서, 집합 내의 모든 숫자가 어떤 값을 가지게 됨으로써 예측 작업이 매우 어렵고 오류에 취약해진다는 점이었습니다.

연구자들은 이 내부 언어를 구조화하는 더 나은 방법이 있는지 오랫동안 궁금해해 왔습니다. 만약 모든 슬롯을 정보로 채우는 대신, 대부분의 숫자는 0이고 오직 소수만이 의미를 갖는 희소한(sparse) 언어를 사용한다면 어떨까요? 이 아이디어는 시스템이 선택적으로 정보를 처리하도록 강제함으로써, 세상이 변하는 규칙을 배우기가 더 쉬워질 수 있음을 시사합니다. 이것이 바로 NYU, 듀크 대학교, 브라운 대학교를 포함한 기관의 연구진이 수행한 새로운 연구에서 탐구하는 핵심 질문입니다. 그들은 이 희소한 접근 방식이 인공지능이 환경을 이해하고 제어하는 것을 더 쉽게 만들 수 있는지 테스트하고자 했으며, 특히 이러한 내부 숫자의 기하학적 구조가 작업의 난이도에 어떤 영향을 미치는지 살펴보았습니다.

연구팀은 이러한 희소 표현을 학습하도록 설계된 LpWorldModel이라는 새로운 시스템을 도입했습니다. 내부 코드의 모든 부분이 활성화되도록 권장했던 이전 방식들과 달리, 이 시스템은 코드 내의 대부분의 숫자가 정확히 0으로 유지되도록 보장하는 특정 수학적 제약 조건을 사용합니다. 그들은 두 가지 서로 다른 환경에서 이 시스템을 훈련시켰습니다. 하나는 점이 문을 통해 이동하는 단순한 내비게이션 작업이고, 다른 하나는 로봇 팔이 T자형 블록을 목표 위치로 밀어야 하는 더 복잡한 조작 작업입니다. 단순한 환경에서는 내부 코드가 조밀하든 희소하든 상관없이 시스템이 잘 작동했는데, 이는 움직임의 규칙이 기본적인 예측기조차 처리할 수 있을 만큼 충분히 단순했기 때문입니다. 그러나 결과는 더 어려운 밀기 작업에서 극적으로 바뀌었습니다.

연구진이 다양한 복잡성을 가진 예측기로 시스템을 테스트했을 때, 희소한 접근 방식이 뚜렷한 이점을 제공한다는 것을 발견했습니다. 예측 모델이 조밀하고 혼란스러운 표현을 처리하기에 충분하지 않은 중간 범위의 복잡성 단계에서, 희소 시스템은 밀집된 시스템이 실패한 지점에서 성공했습니다. 구체적으로, 밀기 작업에서 희소 시스템은 중간 정도의 용량을 가진 예측기를 사용할 때 밀집 시스템에 비해 계획 성공률을 최대 57%까지 향면시켰습니다. 이는 정보를 희소한 형식으로 조직함으로써 시스템이 세상의 역학을 모델링하는 데 필요한 복잡성을 줄였음을 시사합니다. 밀집 시스템은 복잡한 상호작용의 그물을 학습해야 해서 고전한 반면, 희소 시스템은 더 단순하고 직접적인 규칙 세트에 의존할 수 있었습니다.

연구진은 희소 표현이 정보를 놀라울 정도로 해석 가능한 방식으로 조직한다는 사실을 발견하여 성능 향상 이상의 성과를 거두었습니다. 시스템은 자연스럽게 세상의 "모드(mode)"와 상태의 구체적인 세부 사항을 분리했습니다. 에이전트가 있는 구역에 따라 물리 법칙이 변하는 테스트 환경에서, 시스템은 특정 숫자들의 존재 여부(즉, "지지 집합(support)")를 사용하여 자신이 어느 구역에 있는지 식별했으며, 이는 마치 물리 법칙의 유형을 결정하는 스위치처럼 작동했습니다. 그 후 0이 아닌 숫자들의 실제 값은 에이전트의 정확한 위치와 같은 연속적인 세부 사항을 포착했습니다. 이러한 분리를 통해 시스템은 단순히 변하는 픽셀의 덩어리를 보는 것이 아니라, 세상의 규칙이 바뀌었다는 것을 이해할 수 있었습니다.

로봇 팔이 큐브와 상호작용하는 더 복잡한 시나리오에서, 연구진은 희소 시스템이 물체의 물리적 상태(예: 팔이 큐브에 닿아 있는지 여부)를 추적할 수 있다는 것을 발견했습니다. 그러나 추가적인 가이드 없이는 시스템이 큐브와의 접촉이라는 느리고 중요한 사건보다는 팔 자체와 같이 빠르게 움직이는 부분에 집중하는 경항을 보였습니다. 시스템이 시간에 따라 안정적이 되도록 유도하는 간단한 제약 조건을 추가함으로써, 연구진은 시스템의 초점을 조정하여 희소 코드가 팔과 큐브 사이의 접촉을 추적하게 만들 수 있었습니다. 이는 희소 표현이 가장 물리적으로 의미 있는 사건을 강조하도록 조정될 수 있음을 보여주었으며, 내부 코드를 세상의 역학에 대한 읽기 가능한 지도로 탈바꿈시켰습니다.

이 연구는 희소 표현이 현재 인공지능에서 사용되는 밀집 방식에 대한 강력한 대안을 제공한다고 결론짓습니다. 시스템이 선택적으로 정보를 처리하도록 강제함으로써, 연구진은 미래를 예측하는 과업을 훨씬 더 쉽게 만드는 것이 가능하다는 것을 보여주었으며, 이를 통해 더 단순한 모델이 더 나은 결과를 달ことも 가능하게 했습니다. 이 결과는 내부 언어의 기하학적 구조가 매우 중요하다는 점을 시사합니다. 즉, 희소하고 구조화된 접근 방식은 밀집되고 구조화되지 않은 방식보다 시스템의 근본적인 규칙을 더 명확하게 드러낼 수 있습니다. 비록 시스템이 올바른 물리적 사건을 추적하도록 세심한 튜닝이 여전히 필요하지만, 이번 결과는 희소성이 더 효율적이고 해석 가능한 세계 모델을 향한 유망한 경로임을 나타내며, 잠재적으로 기계가 더 적은 계산 능력으로 복잡한 행동을 학습할 수 있게 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →