← 최신 논문
💻 computer science

RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity

RayOcc는 가우시안 혼합 강도와 포아송 이벤트 정식화를 사용하여 광선을 다중 레이블 존재 문제로 모델링함으로써 깊이 모호성과 폐쇄 문제를 해결하고, 이를 통해 여러 점유 가설의 공존을 가능하게 하여 nuScenes 벤치마크에서 최첨단 성능을 달aff하는 카메라 전용 3D 시맨틱 점유 예측 프레임워크이다.

원저자: Junho Kim, Seongwon Lee

게시일 2026-07-21
📖 6 분 읽기🧠 심층 분석

원저자: Junho Kim, Seongwon Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 여러 각도에서 찍은 평면적인 2D 사진들만 가지고 3D 모델을 만들려고 노력 중이라고 상상해 보세요. 이것은 자율주행 자동차가 매일 마주하는 도전 과제입니다. 비싼 레이저 스캐너 없이 오직 카메라만을 사용하여, 자동차가 어디에 있는지, 보도가 어디서 끝나는지, 나무가 얼마나 멀리 있는지와 같은 3D 세상을 이해해야 합니다. 이 분야를 "3D 시맨틱 점유 예측(3D semantic occupancy prediction)"이라고 부릅니다. 이는 마치 안개가 자욱한 상자 안에 숨겨진 물체의 그림자만 보고 그 물체의 형태를 추측하는 것과 같습니다. 까다로운 부분은 "오클루전(occlusion, 가려짐)"인데, 이는 다른 것을 가로막고 있는 물체를 뜻하는 멋진 표현입니다. 만약 큰 트럭이 작은 울타리 앞에 있다면, 카메라는 트럭을 보지만 울타리는 그 뒤에 숨겨지게 됩니다. 현실 세계에서는 트럭과 울타리가 동일한 시선 방향(line of sight) 상에 존재하지만, 오랫동안 컴퓨터 프로그램들은 이 둘을 동시에 보는 데 어려움을 겪었습니다. 프로그램들은 모든 시선 방향에 대해 단 하나의 "승자"만을 선택해야 했고, 이 과정에서 숨겨진 울타리를 잊어버리거나 거리를 잘못 추측하곤 했습니다.

여기서 RayOcc라는 새로운 방법이 등장하여 판도를 바꾸려 합니다. RayOcc는 컴퓨터가 시선 방향을 따라 단 하나의 "최선의 추측"을 선택하도록 강요하는 대신, 여러 가지 가능성을 동시에 상상할 수 있게 해줍니다. 이 방식은 카메라의 시야를 따라 발생하는 일련의 잠재적인 "사건(events)"으로 취급합니다. "가우시안 혼합(Gaussian mixtures, 확률의 겹쳐진 구름이라고 생각하면 쉽습니다)"과 "포아송 사건(Poisson event, 특정 지점에 떨어지는 빗방울의 수를 세는 것과 같습니다)" 모델이라는 영리한 수학적 기법을 사용하여, RayOcc는 "여기에 트럭이 있을 확률이 높고, 또한 그 뒤에 울타리가 있을 확률도 높다"라고 말할 수 있습니다. 연구진은 이를 nuScenes 데이터셋(다양한 주행 장면을 모아놓은 방대한 컬렉션)에서 테스트했으며, RayOcc가 이전 방식들보다 훨씬 더 깨끗하고 정확한 3D 지도를 생성한다는 것을 발견했습니다. 특히 물체가 가려져 있는 복잡하거나 까다로운 장면에서 그 효과가 두드러졌습니다.

문제점: "단 한 명의 승자" 규칙

RayOcc가 왜 특별한지 이해하려면, 먼저 컴퓨터가 일반적으로 3D를 어떻게 "보려고" 하는지 살펴봐야 합니다. 당신이 길고 곧은 복도를 내려다보고 있다고 상상해 보세요. 기존 방식에서 컴퓨터는 그 복도를 보고 "알겠습니다, 10미터 지점에 벽이 있습니다"라고 말할 것입니다. 그러면 컴퓨터는 그 단 하나의 거리만을 선택하고 나머지 모든 것은 무시합니다. 만약 실제로 5미터 지점에 의자가 있고 15미터 지점에 그림이 있다면, 컴퓨터는 혼란에 빠지거나, 혹은 의자를 선택하고 그림은 존재하지 않는 것처럼 치부해 버릴 수 있습니다.

이는 기존의 방법들이 "소프트맥스 정규화(softmax normalization)"라는 규칙을 사용하기 때문에 발생합니다. 이것을 파이(pie)라고 생각해 보세요. 만약 당신에게 파이가 하나 있고, 가능한 모든 거리에 대해 조각을 나눈다면, 파이의 전체 크기는 항상 100%가 되어야 합니다. 만약 당신이 "5미터 지점의 의자"에 아주 큰 조각을 준다면, "15미터 지점의 그림"을 위해 남은 파이는 거의 없게 됩니다. 컴퓨터는 조각들을 서로 경쟁하게 만드는 셈입니다. 의자가 크다면, 그림은 굶주리게 됩니다. 이 방식은 물체가 하나뿐일 때는 괜찮지만, 실제 도시에서는 단 하나의 시선 방향이 자동차를 지나 울타리를 지나 건물까지 이어질 수 있습니다. 시선 방향마다 하나의 조각을 두고 싸우게 만드는 것은 깨진 형태나 파편화된 기하학적 구조처럼 엉망인 3D 모델을 초래합니다.

해결책: 여러 가설이 공존하게 하기

RayOcc는 이 "하나의 파이" 규칙을 버립니다. "여기에 어떤 물체가 있는가?"라고 묻는 대신, "여기에 얼마나 많은 물체가 있을 수 있으며, 각 물체에 대한 증거가 얼마나 강력한가?"라고 묻습니다.

저자들은 **가우시안 혼합 강도(Gaussian Mixture Intensity)**라는 개념을 도입했습니다. 다시 그 복도에 손전등을 비추고 있다고 상상해 보세요. 벽에 단 하나의 점을 칠하는 대신, 손전등이 전체 광선을 따라 "강도(intensity)"의 안개를 뿌리는 것입니다. 이 안개는 여러 개의 정점(peak)을 가질 수 있습니다. 한 정점은 트럭이 있는 곳에서 두껍고 밝을 수 있고, 또 다른 정점은 그 뒤의 울타리가 있는 곳에서 약간 더 흐릿하지만 여전히 명확하게 보일 수 있습니다. 이 "강도"는 (파이처럼) 고정된 총합에 맞춰질 필요가 없기 때문에, 트럭이 울타리의 빛을 뺏어가지 않습니다. 둘은 동시에 강력하게 존재할 수 있습니다.

이 안개를 결정으로 바꾸기 위해, RayOcc는 **포아송 사건 공식화(Poisson event formulation)**를 사용합니다. 이는 무작위 사건에 대한 통계적 사고방식입니다. 당신이 인도 위의 특정 사각형에 빗방울이 떨어지기를 기다리고 있다고 상상해 보세요. 만약 비의 "강도"가 높다면, 적어도 한 방울의 빗방울이 그 사각형에 떨어질 확률은 매우 높습니다. RayOcc는 복도의 각 작은 조각을 인도 위의 사각형처럼 취급합니다. 만약 어떤 물체가 그 조각을 통과하는 "강도"가 충분히 높다면, 시스템은 "네, 이 공간은 점유되어 있습니다"라고 결정합니다. 이를 통해 시스템은 동일한 시선 방향을 따라 여러 조각을 서로 싸우게 하지 않고도 "점유됨"으로 표시할 수 있습니다.

구름에서 3D 덩어리로

시스템이 "강도"의 정점이 어디인지 파악하고 나면, 이제 실제 3D 모델을 구축해야 합니다. 이 논문은 **3D 가우시안 프리미티브(3D Gaussian primitives)**를 사용하는 기술을 사용합니다. 이것들을 공간에 떠 있는 fuzzy하고 빛나는 3D 덩어리라고 생각하면 됩니다. 각 덩어리는 중심, 크기, 색상(또는 자동차나 도로 같은 시맨틱 라벨), 그리고 투명도를 가집니다.

이전 방식들에서 컴퓨터는 보통 단 하나의 "최선의" 깊이 추측을 기반으로 시선 방향마다 단 하나의 덩어리만을 선택했습니다. 그러나 RayOcc는 여러 개의 강도 정점을 살펴봅니다. 만약 트럭에 대한 강한 정점과 울타리에 대한 약하지만 명확한 정점을 본다면, 선택할 필요가 없습니다. 트럭을 위한 덩어리와 울타리를 위한 덩어를 모두 생성할 수 있습니다. 이것을 **적응형 구성 요소별 샘플링(adaptive component-wise sampling)**이라고 합니다. 이는 요리사가 수프에 들어갈 재료를 딱 하나만 고르는 대신, 각 재료의 풍미가 얼마나 강한지에 따라 몇 가지 다른 재료를 추가하여 더 풍부하고 복잡한 요리를 만드는 것과 같습니다.

이 덩어리들은 정제되고 "래스터화(rasterized, 그리드 위에 그려짐)"되어 자율주행 자동차가 항해하는 데 사용하는 최종 3D 지도를 만듭니다.

결과: 더 깨끗한 지도, 더 나은 주행

연구진은 Boston과 Singapore의 1,000개 주행 장면을 포함한 표준 테스트 세트인 nuScenes 벤치마크에서 RayOcc를 테스트했습니다. 그들은 자신들의 방법을 다른 최고 수준의 카메라 전용 시스템들과 비교했습니다.

결과는 RayOcc가 테스트된 가우시안 기반 방법들 중 SOTA(State-of-the-art, 현재 최고 수준) 성능을 달성했음을 보여주었습니다. 구체적으로:

  • 전체 IoU(Intersection-over-Union) 34.84에 도달했습니다.
  • mIoU(mean IoU) 22.03을 달성했습니다.

이를 관점으로 보면, 유사한 접근 방식을 사용한 이전의 최고 방법인 VG3T는 34.06 IoU와 21.74 mIoU를 기록했습니다. RayOcc는 이 수치들을 개선했으며, 이는 RayOcc의 3D 지도가 실제 세계와 더 밀접하게 일치함을 의미합니다.

논문은 이러한 개선이 오클루전(가려짐)이 발생하는 장면—즉, 물체가 다른 것 뒤에 숨겨진 곳—에서 가장 눈에 띈다고 강조합니다. 시각적 비교에서 RayOcc는 얇은 울타드 옆에 있는 트럭의 전체 형태를 재구성할 수 있었던 반면, 다른 방법들은 트럭의 형태가 울타리로 번지거나 울타리를 아예 놓치는 경傾向을 보였습니다. 또한 RayOcc는 3D 덩어리(Gaussians)의 수를 상대적으로 낮게(장면당 평균 약 19,251개) 유지하면서도 높은 정확도를 유지했는데, 이는 단순히 더 많은 데이터를 쏟아붓는 것이 아니라 훨씬 더 지능적으로 사용하고 있음을 시사합니다.

이것이 중요한 이유

이 논문의 핵심 발견은 볼륨 점유(volumetric occupancy)는 단일 선택 문제가 아니라 다중 라벨 문제라는 점입니다. 시선 방향을 따라 물체들이 단 한 명의 "승자"가 되기 위해 경쟁하도록 만드는 것을 멈춤으로써, RayOcc는 훨씬 더 현실적인 세계 표현을 가능하게 합니다. 이는 복잡한 도시에서 단 한 번의 시선이 자동차, 보행자, 건물을 동시에 드러낼 수 있으며, 컴퓨터가 이 모든 것을 동시에 믿을 수 있어야 함을 인정하는 것입니다.

저자들은 이 접근 방식이 특히 까다로운 환경에서 "더 깨끗하고 공간적으로 일관된 점유"를 이끌어낸다고 결론짓습니다. 이 방법은 일부 오래된 방법들에 비해 계산 비용이 다소 증가할 수 있지만, 그 대가는 자율주행 차량의 안전과 계획에 매우 중요한, 3D 세상을 더 신뢰할 수 있게 이해하는 것입니다. 논문은 빛과 물체가 상호작용하는 방식(하나의 경로 상에 여러 개가 존재할 수 있는 방식)과 수학적 모델을 일치시킴으로써, 자율주행 자동차를 위한 더 똑똑하고 안전한 눈을 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →