← 최신 논문
💻 computer science

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

FreeOcc는 3D 주석이나 정답 포즈를 요구하지 않고 단안 또는 RGB-D 시퀀스에서 오픈-어휘 점유도 맵을 생성하기 위해 4 단계 파이프라인을 활용하는 새로운 학습 없는 프레임워크로, 실내 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 집 안을 로봇 동반자와 함께 걷는다고 상상해 보세요. 당신의 목표는 로봇에게 벽의 위치뿐만 아니라 모든 사물의 이름("의자", "램프", 심지어 "꽃병"까지) 을 알려주는 완벽한 3 차원 정신 지도를 구축하는 것입니다. 이는 그 특정 집을 한 번도 본 적이 없는 상태에서도 가능합니다.

보통 로봇에게 이를 가르치는 것은, 아이가 책을 읽기 전에 존재하는 모든 단어가 담긴 사전 전체를 암기하도록 강요하는 것과 같습니다. 로봇이 취하는 모든 단계에 대해 방대한 양의 라벨이 지정된 데이터 (주석) 와 정밀한 GPS 좌표 (자세) 가 필요합니다. 로봇이 본 적이 없는 방에 들어오면, 훈련받은 "단어"들만 알고 있기 때문에 종종 혼란을 겪습니다.

FreeOcc는 게임의 규칙을 바꾸는 새로운 접근법입니다. 이를 교사가 없이도 실시간으로 학습할 수 있는 로봇에게 부여된 초능력으로 생각하세요.

집을 짓는 비유를 사용하여 FreeOcc 가 작동하는 방식을 네 가지 간단한 층으로 나누어 설명합니다.

1. 기초: "스케치 아티스트" (1 층)

먼저 로봇은 카메라를 통해 방을 바라보기 위해 표준 항법 도구 (SLAM 이라고 함) 를 사용합니다. 평면 사진을 찍는 대신, 스케치 아티스트처럼 방의 모양에 대한 거칠고 희박한 윤곽을 빠르게 그려내며 자신이 서 있는 위치를 파악합니다. 사전에 만들어진 지도가 필요 없이, 이동하면서 기하학적 구조를 처음부터 구축합니다.

2. 구조: "3 차원 구름" (2 층)

다음으로 로봇은 그 거친 스케치를 밀도 높고 폭신한 3 차원 점 구름 ( 3D 가우시안이라고 함) 으로 채웁니다. 공간을 채우기 위해 수천 개의 작고 다채로운 풍선을 불어 넣는다고 상상해 보세요. 이 풍선들은 벽, 바닥, 가구를 나타냅니다.

  • 혁신: 대부분의 기존 방법들은 이 풍선들이 다양한 각도에서 그림이 예쁘게 보이도록 떠다니게 하고 흔들리게 하여, 종종 방의 모양을 불안정하고 부정확하게 만듭니다. FreeOcc 는 특별한 규칙을 사용합니다. 1 단계에서 만든 견고한 스케치에 이 풍선들을 "고정"시킵니다. 이로 인해 구조가 단단해지고 실제 기하학적 구조에 충실하게 유지되어, 로봇이 실제로는 곧은 벽이 휘어 있다고 생각하지 않도록 합니다.

3. 라벨: "스마트 번역가" (3 층)

이제 로봇은 3 차원 모양을 갖게 되었지만, 그 모양이 무엇인지는 모릅니다. 여기서 FreeOcc 는 "개념어휘" 초능력을 발휘합니다. "의자"나 "테이블"과 같은 10~20 개의 고정된 단어 목록에 제한되는 대신, 수백만 개의 단어를 알고 있는 거대한 사전 훈련된 "뇌"(시각 - 언어 모델) 에 연결됩니다.

  • 로봇이 풍선 군집을 바라보면 "이것은 무엇처럼 보이나요?"라고 뇌에 묻습니다.
  • " 빨간 컵은 어디 있나요?"라고 물으면, 뇌는 빨간 컵처럼 보이는 풍선들을 찾아 태그를 붙입니다.
  • " 꽃병은 어디 있나요?"라고 물으면, 꽃병을 찾아냅니다.
  • 마법: 이 단어들을 미리 가르칠 필요가 없습니다. 일반적인 지식을 활용하여 실시간으로 3 차원 풍선에 라벨을 붙일 뿐입니다.

4. 최종 지도: "디지털 격자" (4 층)

마지막으로 로봇은 라벨이 붙은 그 풍선 구름을 견고하고 블록 형태의 3 차원 격자 (마인크래프트 세계와 같은) 로 변환합니다. 이 격자의 모든 블록은 두 가지 사실을 알고 있습니다.

  1. 점유 여부: 이 블록이 무엇으로 채워져 있나요, 아니면 빈 공간인가요?
  2. 의미: 채워져 있다면 무엇인가요? (예: "소파", "창문", "식물").

이것이 왜 중요한가요?

  • 훈련 불필요: 라벨이 지정된 수천 개의 비디오를 로봇에게 몇 달 동안 먹일 필요가 없습니다. 바로 사용할 수 있습니다.
  • "진실값" 불필요: "이것은 의자이고, 당신의 카메라는 이 정확한 좌표에 있습니다"라고 인간이 알려줄 필요가 없습니다. 스스로 알아냅니다.
  • 일반화 능력: 특정 방을 암기하지 않기 때문에, 완전히 새로운 집, 공원, 또는 사무실에 들어와도 즉시 지도를 구축할 수 있습니다. 테스트에서, 심한 훈련이 필요했던 다른 방법들보다 두 배 더 잘 수행했으며, 완전히 다른 환경으로 이동했을 때 다른 방법들이 완전히 실패했던 것처럼 충돌하지 않았습니다.

결론

FreeOcc 는 로봇에게 카메라, 노트, 그리고 사전을 주고 "가서 탐험해 봐"라고 말하는 것과 같습니다. 그것은 세상 전체의 3 차원 지도를 구축하고, 사물의 위치를 파악하며, 사물의 이름을 이해합니다. 모든 것은 방을 처음 걷는 동안 이루어집니다. 로봇이 세상을 이해하기 위해 세상을 암기하도록 강요할 필요가 없음을 증명합니다. 단지 관찰하고 추론할 수 있는 올바른 도구를 주면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →