← 최신 논문
💻 computer science

LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map

본 논문은 VLN 및 EQA 벤치마크에서 제로샷 일반화 및 공간적 자기 일관성을 향상시키기 위해 내부 인지 지도를 구축하도록 시공간적 문맥 표현 학습 (ST-CRL) 을 통해 훈련된 이중 기억 시스템을 갖춘 체화 AI 아키텍처인 LASAR 를 제안합니다.

원저자: Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

LASAR 논문에 대한 설명을 비유를 사용하여 쉽고 일상적인 언어로 번역한 것입니다.

큰 문제: "로봇 망각증"

집을 탐색하는 법을 로봇에게 가르친다고 상상해 보세요.

  • 옛날 방식 (모방자): 당신은 로봇에게 부엌에서 침실로 걸어가는 인간의 동영상을 보여줍니다. 로봇은 발걸음을 완벽하게 모방하는 법을 배웁니다. 하지만 의자를 옮기거나 "소파에 대한 전구의 위치는 어디인가요?"라고 묻는다면 로봇은 혼란에 빠집니다. 로봇은 경로를 외웠을 뿐, 지도를 배우지 못했습니다. 이는 시험 문제를 외웠지만 과목 자체는 이해하지 못하는 학생과 같습니다.
  • 다른 옛날 방식 (대화자): 당신은 로봇에게 거대한 뇌 (대형 언어 모델) 를 주고 추론하게 합니다. "내가 소파를 향해 있다면 전구는 내 왼쪽에 있을까?" 로봇은 책에서 단어들이 어떻게 함께 쓰이는지에 기반해 추측할 수 있지만, 실제로 방을 적은 없습니다. 이는 천 개의 여행 가이드를 읽었지만 집 밖으로 나간 적이 없는 사람과 같습니다.

결과: 로봇들은 걷는 것은 잘하지만 이해는 못 하거나, 말하는 것은 잘하지만 걷지는 못 합니다. 그들은 세상이 어떻게 구성되어 있는지에 대한 정신적 그림인 인지 지도 (Cognitive Map) 가 부족합니다.


해결책: LASAR ("정신 스케치북"을 가진 로봇)

저자들은 LASAR라는 새로운 시스템을 개발했습니다. LASAR를 실시간으로 업데이트되는 정신 스케치북(잠재적 인지 지도) 을 장착한 로봇으로 생각하세요.

단순히 발걸음을 외우는 대신, LASAR는 세상에 대한 구조화된 내부 모델을 구축합니다. 이를 위해 두 가지 주요 도구를 사용합니다.

1. 이중 기억 시스템

LASAR 에는 두 개의 수첩이 있다고 상상해 보세요.

  • 수첩 A (일화 기억): 이는 고화질 비디오 다이어리입니다. 로봇이 보고 하는 모든 것을 단계별로 기록합니다. 원본 영상 자료입니다: "빨간 소파를 보았고, 그 다음 왼쪽으로 돌아서 전구를 보았다."
  • 수첩 B (인지 지도): 이는 로봇의 "정신 스케치"입니다. 모든 픽셀을 저장하는 대신, 원본 영상 자료를 구조화된 지도로 조직화합니다. "전구는 소파 곁에 항상 있다"거나 "부엌은 복도 뒤에 있다"와 같은 관계를 학습합니다.

동작 방식: 로봇이 질문에 답해야 할 때, 스케치북을 사용하여 일반적인 영역을 빠르게 찾습니다 ("아, 우리는 소파가 있는 거실에 있군") 그런 다음 비디오 다이어리를 사용하여 구체적인 세부 사항을 확인합니다 ("네, 전구는 그 소파 오른쪽에 있군요").

2. "마인드크래프트 (MindCraft)" 훈련 게임

로봇에게 정신 지도를 그리게 하려면 어떻게 해야 할까요? 단순히 "배워라"라고 말할 수는 없습니다. 로봇이 걷는 동안 퀴즈를 내야 합니다.

저자들은 마인드크래프트라는 훈련 게임을 고안했습니다. 비디오 게임 속 집에서 로봇과 함께 걷는 선생님을 상상해 보세요. 로봇이 걷는 동안 선생님은 로봇을 멈추게 하고 세 가지 유형의 질문을 합니다.

  • 회고적 (뒤돌아보기): "방금 싱크대를 지나갔는데, 왼쪽이었나요 오른쪽이었나요?" (과거에 대한 기억 테스트).
  • 내적 성찰적 (주변 둘러보기): "지금 전구는 소파의 왼쪽에 있나요 오른쪽에 있나요?" (현재 이해도 테스트).
  • 예측적 (앞을 내다보기): "지시사항에 따르면 침실에 가려면 복도를 지나가야 하나요?" (계획 수립 테스트).

로봇이 오답을 내면, 자신의 "정신 스케치북"이 엉망이며 다시 그려야 한다는 것을 알게 됩니다.


비결: ST-CRL ("지도 광택제")

이 논문은 ST-CRL이라는 특별한 훈련 방법을 소개합니다.

로봇의 내부 지도를 점토 조각상으로 생각하세요. 처음에는 형체 없는 덩어리입니다.

  • 문제: 특별한 훈련 없이 로봇은 "전구"라는 말을 들을 때마다 "왼쪽"이라고 말하도록 배우기만 할 수 있습니다. 이는 속이는 것입니다.
  • 해결책 (ST-CRL): 훈련 시스템은 로봇이 방의 구조를 이해하고 있음을 증명하도록 강요합니다. 두 개의 매우 유사한 방이나 두 개의 매우 유사한 질문을 구별해야 하는 "어려운 테스트"를 생성합니다.
    • 비유: 이는 선생님이 학생에게 거의 동일한 지도 두 장을 주고 "어느 쪽에 공원이 왼쪽에 있나요?"라고 묻는 것과 같습니다. 학생이 단순히 추측하면 실패합니다. 실제로 지도의 배치를 이해하면 통과합니다.

이 과정은 로봇의 내부 뇌를 "조각"하여 유사한 방들이 마음속에서 서로 가까이 모이고, 다른 방들은 멀리 떨어지도록 만듭니다. 이는 기억의 뒤죽박죽 더미가 아닌 구조화되고 논리적인 지도를 만들어냅니다.


결과: 왜 중요한가

이 논문은 LASAR 를 두 가지 방식으로 테스트했습니다.

  1. 내비게이션 테스트: 로봇은 지시를 따라 집 안을 걸어야 했습니다.
  2. 추론 테스트: 로봇은 방금 걸어간 집과 관련된 까다로운 질문에 답해야 했습니다 (훈련 중에는 묻지 않았던 질문까지).

결과:

  • 더 나은 걷기: 로봇이 배치를 이해하기 때문에 길을 잃는 일이 덜합니다. 이전 최고의 로봇들에 비해 성공률이 약 2% 에서 5% 향상되었습니다.
  • 더 나은 사고: 훈련 중에는 본 적이 없는 질문 (Zero-Shot) 을 받았을 때 LASAR 는 훨씬 더 똑똑했습니다. 단순히 추측한 것이 아니라, 구축한 지도에 기반해 실제로 추론했습니다.
  • 일관성: 로봇에게 같은 질문을 두 가지 다른 방식으로 ("전구가 소파 왼쪽에 있나요?" 대 "소파가 전구 오른쪽에 있나요?") 물으면, LASAR 는 같은 답을 줍니다. 이전 로봇들은 일관된 지도가 없기 때문에 종종 모순된 답을 내놓았습니다.

요약

LASAR는 단순히 발걸음을 외우는 것을 멈추고 세상에 대한 정신 지도를 구축하기 시작하는 로봇입니다. 로봇이 걷는 동안 주변 환경에 대한 질문에 답하도록 강요하고, 그 답변들을 논리적 구조로 조직화하기 위한 특별한 훈련 방법을 사용함으로써, LASAR 는 3 차원 공간을 진정으로 "보고" "이해"하는 법을 배워 훨씬 더 똑똑하고 신뢰할 수 있는 내비게이터가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →