← 최신 논문
🤖 AI

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything는 2,000만 개의 노이즈가 있는 이질적인 3D 소스로부터 미터법 기반 깊이(metric depth)를 학습하기 위해 새로운 "희소 미터릭 프롬프트(Sparse Metric Prompt)"를 활용하는 확장 가능한 사전 학습 프레임을 도입하여, 미터법 기반 깊이에서의 첫 번째 명확한 스케일링 트렌드를 확립하고 단안 추정, 3D 재구성, 멀티모달 모델의 공간 지능을 포함한 다양한 작업에서 최첨단 성능을 달성했습니다.

원저자: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Metric Anything" 논문을 쉬운 언어와 창의적인 비유를 사용하여 설명한 글입니다.

거대한 문제: "시끄러운 주방"

로봇에게 현실 세계를 3D로 이해하는 법(구체적인 거리/미터법 기반 깊이)을 가르치고 싶다고 상상해 보세요. 이를 위해서는 사진과 그 사진 속 물체들의 정확한 3차원 거리를 보여주는 방대한 양의 "교과서"(데이터셋)가 필요합니다.

문제는 이 교교서들이 엉망진창이라는 점입니다.

  • 어떤 것들은 LiDAR(레이저)로 작성되었습니다. 성능은 좋지만 노이즈가 많고 희소합니다(마치 점이 빠져 있는 스케치 같습니다).
  • 어떤 것들은 컴퓨터가 영상을 통해 재구성한 것으로, 빛이 반사되거나 흐릿한 영역에서 이상한 오류가 생길 수 있습니다.
  • 어떤 것들은 렌더링(컴퓨터 생성)된 것으로, 완벽하지만 가짜처럼 보입니다.
  • 이 모든 데이터는 저마다의 특성과 편향을 가진 수천 개의 서로 다른 카메라로부터 왔습니다.

이런 "시끄러운 주방" 같은 데이터를 가지고 로봇을 가르치려 했던 이전의 시도들은 노이즈 때문에 AI를 혼란에 빠뜨리며 실패했습니다. 과거에는 모든 종류의 노이즈에 대해 복잡하고 맞춤화된 규칙을 만들려고 노력했는데, 이는 확장성이 떨어졌습니다. 그것은 마치 식기세척기를 사용하는 대신, 모든 접시를 일일이 손으로 직접 닦아 주방을 청소하려는 것과 같았습니다.

해결책: "Metric Anything"

저자들은 Metric Anything이라는 새로운 시스템을 만들었습니다. 이것은 어떤 종류의 더러운 접시(데이터 소스)라도 특별한 설정 없이 처리할 수 있는 만능 "식기세洗浄기"라고 생각하면 됩니다.

작동 방식은 다음과 같이 세 단계로 나뉩니다.

1. "희소 프롬프트" (마법의 힌트)

AI에게 3D 세계의 전체 모습을 한꺼번에 보여주는 대신(너무 노이즈가 많기 때문), **희소 미터 프롬프트(Sparse Metric Prompt)**를 제공합니다.

  • 비유: 상자 안에 숨겨진 물체의 모양을 맞히려고 한다고 상상해 보세요. 상자 전체를 보여주는 대신, 누군가 몇 개의 무작위 "힌트"(점)를 주어 특정 지점들의 정확한 거리를 알려줍니다.
  • 방법: 3D 맵을 가져온 뒤 대부분을 숨기고, 오직 몇 개의 흩어진 점들과 그 점들의 정확한 거리만을 AI에게 보여줍니다.
  • 효과: 이를 통해 AI는 특정 카메라의 노이즈 패턴을 암기하는 것이 아니라, 공간의 논리(물체들이 서로 어떻게 관계를 맺는지)를 학습하게 됩니다. 즉, "공간적 추론"과 "센서의 편향"을 분리하는 것입니다.

2. "선생님" (사전 학습된 모델)

그들은 이 시스템에 엄청난 양의 데이터를 입력했습니다: 10,000개 이상의 서로 다른 카메라 모델에서 얻은 2,000만 개의 이미지-깊이 쌍입니다.

  • 비유: 이것은 영어나 프랑스어, 혹은 만들어진 언어로 쓰인 책이라 할지라도 도서관의 모든 책을 읽은 천재 튜터를 고용하는 것과 같습니다.
  • 결과: 이 "선생님" 모델은 사진과 몇 개의 무작위 거리 힌트를 보고, 나머지 3D 세계를 완벽하게 채워 넣는 법을 배웁니다. 이 모델은 데이터를 더 많이 줄수록 더 똑똑해지는 "스케일링 트렌드(scaling trend)"를 보여주는데, 이는 이전에는 이 작업에서 불가능하다고 여겨졌던 부분입니다.

3. "학생" (지식 증류 모델)

"선생님"은 훌륭하지만, 작동하려면 "힌트"(프롬프트)가 필요합니다. 자율주행 자동차나 로봇 같은 실제 환경에서는 그런 힌트를 사용할 수 없는 경우가 많습니다.

  • 비유: 선생님은 레시피 카드가 필요한 마스터 셰프입니다. 학생은 그 셰프의 조수입니다. 선생님은 레시피 카드를 사용해 수천 번 요리를 하고, 조수는 옆에서 지켜보며 카드 없이도 기술을 익힙니다.
  • 결과: 그들은 선생님으로부터 배운 "학생" 모델을 만들었습니다. 이제 이 "학생" 모델은 평범한 사진만 보고도 힌트나 프롬프트 없이 즉각적으로 정확한 3차원 거리를 알 수 있습니다.

무엇을 할 수 있는가? (초능력)

이 시스템은 매우 다양하고 노이즈가 많은 데이터로부터 학습했기 때문에 믿기지 않을 정도로 강력합니다. 논문은 이 모델이 다음 작업에서 탁월함을 보여준다고 설명합니다.

  • 빈칸 채우기: 흐릿하거나 저해상도인 깊이 맵을 주더라도, 이를 선명하고 상세하게 만드는 "초해상도(super-resolve)" 기능을 수행합니다.
  • 센서 혼합: 레이더(Radar)(LiDAR보다 훨씬 희소함)의 매우 희소하고 노이즈가 섞인 신호를 카메라와 결합하여 완벽한 3D 지도를 만들어낼 수 있습니다.
  • 카메라 수정: 사진을 보고 장면의 기하학적 구조를 이해함으로써 카메라 설정(초점 거리 등)을 추측할 수 있습니다.
  • 로보틱스 및 AI: 이 "공간적 두뇌"를 로봇(VLA)이나 대규모 언어 모델(MLLM)에 부여했을 때, 로봇은 방을 탐색하고, 컵이 얼마나 멀리 있는지 추정하며, 경로를 계획하는 능력이 훨씬 좋아졌습니다. 로봇은 더 이상 짐작하는 것이 아니라 측정하기 시작했습니다.

핵심 요약

이 논문은 더 많은 데이터 + 노이즈를 다루는 단순하고 스마트한 방법 = 더 나은 3D 두뇌라는 것을 증명합니다.

그들은 복잡하고 맞춤화된 하드웨어를 만들거나 모든 카메라를 위한 특별한 규칙을 쓸 필요가 없었습니다. 단지 간단한 "힌트 기반"의 학습 방법과 거대하고도 지저받은 데이터셋이 필요했을 뿐입니다. 결과적으로, 이 모델은 이전의 어떤 시스템보다도 3D 세계를 잘 이해하며, 비 오는 거리부터 만화 속 세상, 로봇의 주방에 이르기까지 어디서든 작동합니다.

요약하자면: 그들은 수백만 개의 지저분한 사진과 몇 개의 무작위 단서를 보여줌으로써 AI에게 거리를 이해하는 법을 가르쳤고, 이제 그 AI는 그 어느 때보다 더 완벽하게 3D 세상을 볼 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →