← 최신 논문
💻 computer science

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

X-Lens는 학습 가능한 캘리브레이션 토큰과 야코비안 매개변수화된 왜곡 바이어스를 활용하여, 새로 출시된 대규모 합성 데이터셋인 OmniScene을 통해 학습됨으로써 이질적인 어안 및 핀홀 카메라로부터 강건한 메트릭 깊이 추정을 달성하는 소형 실시간 피드포워드 모델이다.

원저자: Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 카메라 배낭을 메고 세상의 3D 지도를 만들려고 한다고 상상해 보세요. 대부분의 로봇과 자율주행 자동차는 다양한 렌즈가 섞인 배낭을 메고 있습니다. 어떤 것은 멀리 있는 것을 선명하게 보는 표준 "핀홀(pinhole)" 카메라(당신의 스마트폰 같은 것)이고, 다른 것은 주변의 모든 것을 거대한 곡선형 거품처럼 보여주는 "어안(fisheye)" 렌즈입니다.

문제는 무엇일까요? 이 두 렌즈는 서로 다른 기하학적 언어를 사용한다는 점입니다. 어안 렌즈는 마치 유령 집의 거울처럼 이미지의 가장자리를 늘려 놓는 반면, 핀홀 렌즈는 사물을 직선으로 유지합니다. 오랫동안 컴퓨터는 이 두 가지 뷰를 결합하여 실제 세계의 미터(m) 단위로 물체가 얼마나 멀리 떨어져 있는지 파악하는 데 어려움을 겪었습니다. 컴퓨터는 계산을 틀리거나, 엄청난 성능의 슈퍼컴퓨터를 필요로 하거나, 중요한 세부 정보를 잃어버리면서 이미지를 이상한 "파노라마" 형태로 펼쳐야만 했습니다.

여기에 등장한 것이 바로 X-Lens입니다. X-Lens는 이 혼합된 카메라들을 위한 숙련된 통역사 역할을 하는 작고 매우 빠른 새로운 AI 모델입니다.

마법의 통역사

X-Lens를 0.04-빌리언(0.04B) 파라미터를 가진 컴팩트한 "두뇌"라고 생각해 보세요 (이는 1 빌리언 이상의 파라미터를 가진 다른 모델들에 비해 매우 작은 크기입니다). X-Lens는 어안 이미지와 핀홀 이미지를 억지로 똑같이 만들려고 노력하는 대신, 각각의 이미지를 있는 그대로 받아들입니다.

이 모델은 혼돈을 이해하기 위해 두 가지 영리한 기술을 사용합니다:

  1. 학습 가능한 보정 토큰(Learnable Calibration Tokens): 이것은 AI가 어감 이미지 위에 붙이는 작은 포스트잇과 같습니다. 이 메모들은 AI에게 "이봐, 이 부분의 이미지는 렌즈 때문에 늘어난 것이니 모양을 너무 신뢰하지 마"라고 알려줍니다. 이를 통해 AI는 이미지를 먼저 찌그러뜨리지 않고도 휘어진 어감 뷰를 직선 형태의 핀홀 뷰와 정렬할 수 있습니다.
  2. 자코비안 왜곡 편향(Jacobian Distortion Bias): 이것은 AI를 위한 특별한 나침반과 같습니다. 모델은 이미지의 모든 미세한 지점에서 빛의 광선이 어떻게 굴절되는지 정확히 계산합니다. 이 "굴절 지도"를 AI의 어텐션 시스템에 입력함으로써, 모델은 왜곡을 무시하고 실제 세계의 3D 형태에 집중하는 법을 배웁니다.

그 결과, X-Lens는 6개의 혼합 카메라(어감 4개, 핀홀 2개)를 보고 즉각적으로 실제 세계의 스케일을 가진 조밀한 깊이 지도(depth map)를 생성해 낼 수 있습니다. 단순히 "가깝다" 또는 "멀다"라고 추측하는 것이 아니라, 어떤 물체가 정확히 11.07미터 또는 31.64미터 떨어져 있는지 알려줍니다. 또한 이를 **초당 41 프레임(41 FPS)**의 속도로 수행하므로, 로봇이 실시간으로 장애물을 피하기에 충분히 빠릅니다.

거대한 연습장: OmniScene

X-Lens가 이 작업을 수행하는 방법을 배우기 위해, 연구진은 기존 사진들을 단순히 사용할 수 없었습니다. 왜냐하면 완벽한 3D 측정값이 포함된 혼합 카메라 예시가 충분하지 않았기 때문입니다. 그래서 그들은 거대한 합성 세계인 OmniScene을 구축했습니다.

그들은 103개의 서로 다른 장면(쇼핑몰부터 공상과학 복합 단지까지)을 만들었고, 가상의 6개 카메라 리그를 사용하여 266,000개의 동기화된 프레임을 생성했습니다. 이는 조종사가 실제 비행기에 타기 전, 가능한 모든 기상 조건과 활주로를 경험해 본 비행 시뮬레이터에서 훈련받는 것과 같습니다. 이 데이터에는 완벽하고 노이즈가 없는 깊이 레이블이 포함된 170만 개의 개별 이미지가 들어 있습니다.

숫자가 말해주는 것

논문은 X-Lens를 해당 분야의 가장 크고 무거운 모델들과 테스트했습니다. 결과는 다음과 같습니다:

  • 속도: X-Lens는 단일 고성능 GPU에서 41 FPS로 실행되는 반면, 가장 강력한 경쟁 모델들은 대개 5~13 FPS로 실행됩니다.
  • 크기: X-Lens는 0.04B 파라미터를 사용합니다. 차세대 경쟁 모델인 MapAnything는 1.23B 파라미터를 사용합니다. 즉, X-Lens는 베이스라인보다 88.9% 더 작습니다.
  • 정확도: 혼합 카메라 테스트(OmniScene-Full)에서 X-Lens는 가장 강력한 베이스라인과 비교했을 때 오차(AbsRel)를 25.4% 줄였습니다. 또한 실제 세계의 크기를 추측하는 능력(Scale AbsRel)에서 MapAnything보다 68.1% 향상된 성능을 보였습니다.

X-Lens가 할 수 없는 것

이 모델이 무엇을 하지 않는지 아는 것도 중요합니다. 논문은 그 한계를 명확히 밝히고 있습니다:

  • 카메라 설정을 예측하지 않습니다: X-Lens는 시작하기 전에 카메라 렌즈가 어떻게 생겼는지(보정값)에 대한 정보를 전달받아야 합니다. 스스로 렌즈 유형이나 카메라 위치를 추측할 수 없습니다.
  • 특이한 렌즈를 위한 만능 해결사가 아닙니다: 이 모델은 특정 유형의 어감 및 핀홀 렌즈를 대상으로 학습되었습니다. 만약 학습 데이터와 완전히 다른, 본 적 없는 극단적인 시야각을 가진 렌즈를 입력한다면, 논문은 해당 모델이 본 적 없는 특정한 "유령 집 거울" 효과 때문에 성능이 약간 떨어질 수 있음을 시사합니다.
  • 일반적인 3D 재구성 도구가 아닙니다: 카메라의 포즈, 렌즈 유형, 그리고 3D 지도를 한꺼번에 추측하려고 시도하는 거대 모델들과 달리, X-Lens는 특화되어 있습니다. 이 모델은 오직 깊이와 스케일에 집중하며, 이것이 바로 매우 빠르고 작은 이유입니다.

결론

X-Lens는 혼합 카메라를 통해 3차원 공간을 이해하기 위해 반드시 거대하고 느린 컴퓨터가 필요한 것은 아님을 증명합니다. 스마트한 기하학적 설계와 거대하고 고품질인 합성 데이터셋을 사용함으로써, 이 모델은 에지 디바이스(edge devices)에서도 실행될 수 있을 만큼 작으면서도 최첨단의 정확도를 달행합니다. 이는 로봇이 슈퍼컴퓨터를 배낭에 넣지 않고도 실시간으로 3D 세계를 진정으로 "볼 수 있게" 만드는 단계로 나아가는 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →