Human-in-the-Loop Atlas-Based 3D Asset Segmentation for Interactive Content Workflows
이 논문은 탐욕적 뷰 선택(greedy view selection), SAM 2와 Label Studio를 이용한 대화형 세그멘테이션, 그리고 역투영(back-projection)을 결합하여 3D 모델로부터 분할된 2D 파라미터화된 아틀라스를 생성함으로써, 인터랙티브 콘텐츠 워크플로를 위한 재질 할당 및 스타일 전이와 같은 효율적인 다운스트림 작업을 가능하게 하는 인간 참여형(human-in-the-loop) 파이프라인을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 조각상에 붓 대신 거대하고 평평한 종이를 사용하여 모든 곡선과 굴곡에 완벽하게 들어맞도록 감싸야 한다고 상상해 보십시오. 이것이 바로 3D 에셋 세그멘테이션(3D asset segmentation)의 세계입니다. 이는 예술가와 엔지니어가 디지털 모델을 의미 있는 조각으로 나누어 색을 입히거나, 질감을 입히거나, 애니메이션을 만들 수 있도록 하는 컴퓨터 그래픽의 한 분야입니다. 3D 모델을 복잡한 레고 성이라고 생각해보세요. 창문이나 지붕의 색만 바꾸고 싶다면, 어떤 레고 블록이 창문에 속하고 어떤 블록이 지붕에 속하는지를 정확히 알아야 합니다. 오랫동안 컴퓨터는 이를 자동으로 수행하는 데 어려움을 겪어 왔으며, 종종 기괴한 모양이나 어디서나 비슷해 보이는 매끄러운 표면 때문에 혼란에 빠지곤 했습니다. 똑똑한 컴퓨터 프로그램(파운데이션 모델이라 불리는)들이 평면적인 2D 사진에서 사물을 식별하는 데는 매우 능숙해졌지만, 특정 비디오 게임이나 가상 현실 경험에 적합한 방식으로 3D 객체를 어떻게 분할할지 결정하는 데는 여전히 실수를 범하곤 합니다. 이것이 바로 연구자들이 더 나은 방법을 찾는 이유입니다. 즉, AI의 속도와 인간 전문가의 세심한 눈을 결합하여 인간이 컴퓨터를 안내할 수 있는 방법 말입니다.
이 논문은 이 퍼즐을 풀기 위해 로봇과 인간 예술가의 하이테크 팀처럼 작동하는 영리하고 새로운 파이프라인을 소개합니다. 프라운호퍼 IGD(Fraunhofer IGD)의 연구진은 먼저 3D 객체의 모든 면을 볼 수 있도록 완벽한 카메라 각도를 찾아내어 어느 곳도 어둠 속에 남겨지지 않도록 하는 시스템을 만들었습니다. 그들은 이를 "탐욕적 집합 피복 전략(greedy set cover strategy)"이라고 부르는데, 이는 컴퓨터가 "전체를 보기 위해 얼마나 적은 수의 사진을 찍을 수 있을까?"라는 게임을 하는 방식이라는 뜻입니다. 일단 이 사진들을 확보하면, 시스템은 SAM 2라고 불리는 강력한 AI 도구를 사용하여 객체의 서로 다른 부분들이 어디에 있는지 추측합니다. 하지만 여기서 반전이 있습니다. 컴퓨터는 혼자서 작업하지 않습니다. 인간이 개입하여 AI의 작업을 검토하고, AI가 혼란을 겪는 부분에 선을 그려 수정합니다. 마지막으로, 컴퓨터는 이렇게 수정된 2D 드로잉들을 다시 3D 모델 위에 맞춤형 스티커 시트처럼 입혀서 "세그멘티드 아틀라스(segmented atlas)"를 생성합니다. 이 아틀라스는 모든 작은 사각형이 3D 객체의 어느 부분에 속하는지 정확히 알고 있는 평면 지도로, 비디오 게임이나 영화 제작의 다음 단계를 위한 준비가 된 상태입니다.
연구팀은 미켈란젤로의 다비드상 대리석 머리부터 빅토리아 시대의 의자, 중세의 검에 이르기까지 8가지의 서로 다른 문화유산 객체를 대상으로 이 방법을 테스트했습니다. 그들은 이 시스템이 크고 명확한 영역에는 매우 잘 작동하지만, 아주 작은 디테일, 깊은 구멍, 또는 이웃한 부분과 똑같이 생긴 부분과 같은 까다로운 지점에서는 여전히 인간의 손길이 필요하다는 것을 발견했습니다. 예를 들어, 다비드상에서 AI는 머리카락과 목은 쉽게 식별할 수 있었지만, 대리석이 너무 매끄럽고 대비가 부족했기 때문에 눈과 귀 같은 미세한 부분은 사람이 직접 그려야 했습니다. 마찬가지로, 의자의 움푹 파인 밑부분의 경우 카메라가 어두운 구석을 보기 어려워 추가적인 수동 작업이 필요했습니다. 전반적으로 이 과정은 객체당 15분에서 35분이 소ya 걸렸으며, 더 복잡한 조각상은 더 오랜 시간이 걸렸습니다. 결과는 AI가 큰 도움이 되기는 하지만 아직 완벽하지는 않다는 것을 보여주었습니다. 가장 좋은 결과는 컴퓨터가 힘든 일을 하고 인간이 미세 조정을 하는 "휴먼 인 더 루프(human-in-the-loop)" 접근법에서 나왔습니다. 저자들은 이 방법이 인터랙티브 콘텐츠를 만들기 위한 견고하고 사용 가능한 진전이라고 제안하면서도, 이것이 모든 문제를 자동으로 해결하는 마법 지팡이는 아니라는 점을 인정했습니다. 그들은 향에 이 방법이 실제 전문적인 환경에서도 유효한지 확인하기 위해 향후 더 많은 사람을 대상으로 테스트할 계획입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.