← 최신 논문
🤖 machine learning

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

본 논문은 엔드투엔드 학습된 잠재 임베딩의 기하학적 구조를 표준화된 태스크 관련 상태 공간과 정렬함으로써, 추가적인 계획 시점의 오버헤드 없이도 임베딩 공간의 고분산 방향이 효과적으로 상태 정보를 포착하도록 보장하여 JEPA 계획 성능을 향상시키는 경량 훈련 시 정규화 기법인 SCALE을 제안한다.

원저자: Jiaming Hu, Yan Zheng, Tian Wang

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaming Hu, Yan Zheng, Tian Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

살아있는 존재처럼 생각하고 행동할 수 있는 기계를 구축하려는 탐구에서, 연구자들은 오랫동안 '세계 모델(world model)'이라고 알려진 개념에 의존해 왔습니다. 단순히 현재 보이는 것에 반응하는 것이 아니라, 미래를 정신적으로 시뮬레이션하는 로봇을 상상해 보십시오. 로봇은 근육 하나를 움직이기 전에 스스로에게 묻습니다. "내가 저 컵을 향해 손을 뻗으면 어떤 일이 벌어질까?" 로봇은 일련의 사건들을 상상하고, 결과를 예측하며, 그 후에야 최선의 결과를 이끌어내는 행동을 선택합니다. 이러한 시뮬레이션이 작동하려면, 기계는 빠르게 계산할 수 있을 만큼 압축적이면서도 유용할 만큼 상세한 방식으로 세상을 표현할 방법이 필요합니다. 만약 표현 방식이 너무 무질서하면 로봇은 노이즈 속에서 길을 잃게 되고, 너무 단순하면 성공에 필요한 결정적인 세부 사항을 놓치게 됩니다. 과제는 기계의 내부 세계 지도가 단순히 정확할 뿐만 아니라, 계획을 세우기 쉽도록 조직화된 균형점을 찾는 데 있습니다.

보스턴 대학교와 유니티 테크놀로지스(Unity Technologies)의 연구진이 발표한 최근 연구는 이러한 정신적 지도가 현재 어떻게 구축되는지에 대한 미묘하지만 결정적인 결함을 다룹니다. 그들은 기계가 특정 과제를 완벽하게 이해하는 법을 배울 수 있음에도 불구하고, 계획을 세우려 할 때 그 이해를 사용하지 못할 수 있다는 사실을 발견했습니다. 문제는 정보가 누락된 것이 아니라, 정보가 기계의 내부 기하학적 구조 내에서 잘못된 부분에 숨겨져 있다는 것입니다. 이를 해결하기 위해 연구팀은 SCALE이라는 새로운 방법을 개발했는데, 이는 기계가 의사결정을 내릴 때 가장 중요한 세부 사항이 가장 두드러지게 나타나도록 기계의 내부 지도를 재형성하는 방식입니다.

연구진은 먼저 기계가 세상을 표현하는 두 가지 서로 다른 방식을 살펴보았습니다. DINO-WM이라 불리는 시스템에서 사용하는 한 가지 접근 방식은 로봇이 특정 과제를 접하기 전, 방대한 양의 데이터로부터 학습된 특징들에 의존합니다. 이 방식은 중요한 상태들 사이의 차이점을 쉽게 식별할 수 있는 지도를 자연스럽게 만들어냅니다. 반면, LeWorldModel로 알려진 다른 접근 방식은 기계가 미래를 예측하도록 처음부터 학습시킵니다. 이 방식은 유연하고 빠르게 학습하지만, 연구진은 결과물인 지도가 종종 가장 중요한 정보를 숨긴다는 것을 발견했습니다. 비록 기계가 직접 질문을 받는다면 이론적으로 정답을 추출할 수 있을지라도, 서로 다른 미래 가능성 사이의 거리를 측정하는 방식이 무관한 세부 사항들에 의해 지배되었기 때문입니다. 이는 마치 도서관의 모든 책이 올바르게 분류되어 있지만, 사서가 실제 내용을 확인하는 대신 책 표지의 색깔만을 보고 책을 고르는 것과 같았습니다.

왜 이런 현상이 발생하는지 이해하기 위해, 기계가 어떤 행동을 취할지 결정하는 과정을 생각해 보십시오. 기계는 가능한 많은 미래를 상 imagin(상상)하고, 자신이 도달할 것이라고 생각하는 지점과 가고자 하는 목표 지점 사이의 거리를 측정합니다. 처음부터 학습하는 시스템에서는, 기계의 내부 거리 측정 방식이 데이터의 가장 흔한 변동 사항들에 의해 크게 영향을 받는데, 이러한 변동 사항들은 대개 현재 수행 중인 과제와는 무관한 것들입니다. 물체의 위치나 관절의 각도와 같은 과제의 핵심 정보는 기계의 메모리에 인코딩되어 있을 수 있지만, 계획 과정에서 거의 주목받지 못하는 지도의 조용한 구석에 자리 잡고 있습니다. 기계는 강요받는다면 정보를 해독할 수 있지만, 선택이 필요한 순간에는 그 정보를 사용하지 않습니다.

연구팀은 기계가 지도를 다르게 조직하도록 강제하는 해결책을 제안했습니다. 그들은 기계의 내부적인 거리 감각을 실제 세계의 물리적 거리와 직접 연결하는 훈련 규칙을 도입했습니다. 훈련 과정에서 시스템은 여러 상황의 쌍을 제시받으며, 만약 두 상황이 현실에서 멀리 떨어져 있다면 기계의 내부 표현에서도 반드시 멀리 떨어져 있어야 한다는 지침을 받습니다. 이것은 기계의 학습 과정을 대체하는 것이 아니라, 기계가 가장 과제 관련성이 높은 차이점들을 가장 두드ful한 특징으로 만들도록 내부 지도를 재배열하도록 부드럽게 유도하는 가이드 역할을 합니다. 이를 통해 기계가 미래 행동의 비용을 계산할 때, 그 계산이 실제로 성공에 중요한 세부 사항들에 의해 주도되도록 보장합니다.

이 접근 방식의 결과는 놀라웠습니다. 연구진은 블록 밀기부터 미로 찾기까지 다섯 가지 환경에서 세 가지 계획 알고리즘을 사용하여 새로운 방법인 SCALE을 테스트했습니다. 모든 테스트에서 SCALE로 훈련된 시스템은 처음부터 학습하는 표준 시스템보다 뛰어난 성능을 보였습니다. 이러한 개선은 컴퓨록 파워가 얼마나 가용하든, 혹은 어떤 계획 알고리즘을 사용하든 상관없이 일관되게 나타났습니다. 성공의 원인이 단순히 더 나은 메모리 때문이 아니라 새로운 기하학적 구조 덕분임을 증명하기 위해, 연구진은 기계의 메모리로부터 과제 정보를 더 쉽게 읽어내도록 시도하는 다른 방법과 비교했습니다. 그 대안적인 방법은 정보를 정확하게 읽어낼 수는 있었지만, SCALE만큼 일관되게 계획 성능을 향상시키지는 못했습니다. 이는 핵심이 단순히 정보를 보유하는 것이 아니라, 계획가가 실제로 사용할 수 있는 방식으로 정보를 배치하는 데 있음을 확인시켜 주었습니다.

이 연구는 인공지능에 대한 근본적인 통찰을 보여줍니다. 즉, 표현의 품질은 어떤 정보를 포함하고 있느냐뿐만 아니라, 그 정보가 어떻게 구조화되어 있느냐에 달려 있다는 점입니다. 기계는 머릿속에 정답을 담고 있을 수 있지만, 그 정답으로 가는 경로가 잘못된 종류의 노이즈에 의해 가려져 있다면 기계는 실패할 것입니다. 연구진은 세계 모델의 내부 기하학을 실제 과제에 맞게 조정함으로써 계획이 훨씬 더 신뢰할 수 있게 된다는 것을 보여주었습니다. 이 연구는 기계가 진정으로 복잡한 과제를 마스터하기 위해서는, 세상을 보는 법뿐만 아니라 자신이 내려야 할 결정에 유의미한 방식으로 세상을 보는 법을 가르쳐야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →