← 최신 논문
💻 computer science

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

이 논문은 비용이 많이 드는 장면별 최적화 과정 없이도 Visual Geometry Grounded Transformer(VGGT)를 효과적으로 무력화하기 위해, 단 한 번의 피드포워드 패스(feed-forward pass)로 일관된 다중 뷰 적대적 섭동을 생성하는 새로운 프레임워크인 MVAP-G를 소개한다.

원저자: Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능 세계에서, 평면적인 사진으로부터 3차원 세계를 이해할 수 있는 새로운 세대의 컴퓨터 비전 시스템이 등장했습니다. 파운데이션 모델(foundation models)로 알려진 이 시스템들은 시각적 데이터를 위한 보편적인 번역기 역할을 합니다. 단순히 이미지가 자동차나 나무를 포함하고 있다고 식별하는 것을 넘어, 이들은 서로 다른 각도에서 촬영된 여러 장의 사진을 결합하여 장면의 완전하고 탐색 가능한 3D 모델을 구축할 수 있습니다. 이 기술은 로봇이 어떻게 길을 찾는지, 자율주행 차량이 주변 환경을 어떻게 인식하는지, 그리고 우리가 디지털 환경과 어떻게 상호작용하는지를 혁신할 것으로 기대됩니다. 그러나 물리적 구조물에 엔지니어가 보강해야 할 약점이 있듯이, 이러한 디지털 시스템에도 숨겨진 취약점이 존재합니다. 연구자들은 이미지에 아주 미세하고 눈에 보이지 않는 양의 노이즈를 추가함으로써 컴퓨터가 존재하지 않는 것을 보게끔 속일 수 있다는 사실을 오래전부터 알고 있었습니다. 이것이 바로 머신의 이해력을 대규모로 무너뜨리는 가장 작은 변화를 찾아내는 영역인 적대적 공격(adversarial attacks)의 세계입니다.

문제는 항상 속도와 일관성이었습니다. 이러한 기만적인 이미지를 생성하는 전통적인 방법들은 컴퓨터가 특정 장면을 분석하기 위해 상당한 시간을 소비하며, 그 단일 순간을 위한 완벽한 노이즈 패턴을 계산해야 합니다. 이 과정은 장면이 즉각적으로 변하는 실제 응용 분야에서는 너무 느립니다. 다른 방법들은 모든 이미지에 단일한 정적 노이즈 패턴을 적용하여 어디서나 작동하기를 기대하지만, 이러한 방식은 변화하는 장면의 기하학적 구조에 적응할 수 없기 때문에 복잡한 3D 시스템을 상대로는 실패하는 경우가 많습니다. 홍콩 배티스 대학(Hong Kong Baptist University)의 연구팀은 이제 이 두 가지 문제를 동시에 해결하는 새로운 접근 방식을 개발했습니다. 그들은 여러 관점의 장면에 걸쳐 일관되고 보이지 않는 공격을 단 한 번의 순간에 생성할 수 있는 시스템을 만들었으며, 이는 새로운 상황마다 멈춰서 계산할 필요가 없습니다.

연구진은 시각적 기하학 기반 트랜스포머(Visual Geometry Grounded Transformer)라고 불리는 특정 고성능 모델에 연구를 집중했습니다. 이 모델은 일련의 이미지를 받아들여 즉각적으로 3D 포인트 클라우드(3D point cloud)를 재구성하도록 설계되었는데, 이는 물체의 모양과 위치를 나타내는 수백만 개의 점으로 이루어진 디지털 골격과 같습니다. 연구팀은 이 모델이 정상적인 조건에서는 매우 빠르고 정확하지만, 특정 유형의 조직적인 기만에 직면했을 때는 놀라울 정도로 취약하다는 것을 발견했습니다. 그들은 '다중 뷰 적대적 섭동 생성기(multi-view adversarial perturbation generator)'라고 명명한 도구를 구축했는데, 이는 마치 초고속 카메라 필터처럼 작동합니다. 장면을 분석한 뒤 천천히 속임수를 만들어내는 대신, 이 도구는 모델의 약점 패턴을 학습하고 모든 이미지에 맞춤형 왜곡을 동시에 적용합니다.

이것이 작동하게 하려면 시스템은 어려운 균형 잡기를 학습해야 했습니다. 3D 재구성을 산산조각 낼 만큼 강력하면서도 인간의 눈에는 절대 보이지 않을 만큼 미세한 노이즈를 만들어내야 했습니다. 연구진은 노이즈가 모든 서로 다른 카메라 각도에서 일관되게 유지되도록 강제하는 메커니즘을 설계했습니다. 만약 노이즈가 각도에 따라 다르게 보인다면, 3D 모델은 이를 오류로 간주하고 스스로 수정할 가능성이 높기 때문입니다. 모든 뷰에 걸쳐 왜곡이 완벽하게 정렬되도록 보장함으로써, 시스템은 모델의 내부 논리를 혼란시켜 장면의 기하학적 구조에 대한 통제력을 잃게 만들 수 있었습니다. 그 결과, 입력 이미지는 인간 관찰자에게는 완벽하게 정상적으로 보이면서도, 재구성된 세계가 혼돈의 덩어리로 해체되거나 완전히 사라져 버리는 완전한 3D 구조의 붕괴가 일어났습니다.

실험 결과, 이 새로운 방법은 이전의 시도들보다 훨씬 우수했습니다. 이러한 시스템을 깨뜨리기 위해 사용되는 표준 모델들을 대상으로 테스트했을 때, 새로운 생성기는 단 한 단계 만에 목표를 달ей한 반면, 기존 방법들은 유사한 결과를 얻기 위해 수십 번의 느리고 반복적인 계산을 필요로 했습니다. 최대 25개의 서로 다른 카메라 뷰를 포함하는 장면을 대상으로 한 테스트에서, 새로운 시스템은 3D 재구성의 품질을 지속적으로 저하시켜 디지털 점들이 흩어지거나 아무것도 없는 상태로 줄어들게 만들었습니다. 연구진은 이 공격이 3D 형태 자체뿐만 아니라, 항해에 필수적인 깊이(depth) 및 카메라 위치를 추정하는 모델의 능력에도 효과적이라는 것을 발견했습니다. 시스템은 선명하고 상세한 방의 지도를 순식간에 파편화되어 사용할 수 없는 점 구름으로 바꿀 수 있었습니다.

이 발견의 가장 놀라운 측면 중 하나는 공격의 효율성입니다. 연구진은 자신들의 도구가 여러 뷰를 가진 복잡한 장면을 전통적인 방법이 요구하는 컴퓨터 메모리의 극히 일부만을 사용하여 1초 미만에 처리할 수 있음을 입증했습니다. 이러한 속도는 이 공격이 거리의 로봇이나 도시를 비행하는 드론과 같은 실시간 시나리오에 이론적으로 배치될 수 있음을 시사합니다. 연구는 단일한 정적 노이즈 패턴이 이러한 복잡한 3D 모델에 작용할 수 없음을 명시적으로 보여주었으며, 대신 노이즈가 효과적이려면 서로 다른 카메라 각도 사이의 관계를 인지하는 동적인 형태여야 함을 보여주었습니다. 연구팀 또한 이 공격이 크고 명백한 왜곡에 의존하지 않는다는 점을 확인했습니다. 변화는 너무 미미하여 인간의 눈에는 보이지 않았으며, 원래 사진의 질감과 외형을 유지하면서도 공간을 이해하는 머신의 능력을 완전히 파괴했습니다.

이 연구의 함의는 실험실을 넘어 확장됩니다. 연구진은 자신들의 발견이 3D 비전 시스템 배포에 있어 심각한 보안 격차를 강조한다고 말합니다. 만약 모델이 이토록 쉽고 빠르게 속을 수 있다면, 자율주행 자동차나 로봇 항해와 같이 이 모델에 의존하는 애플리케이션의 안전이 위협받을 수 있습니다. 이 연구는 이러한 시스템이 수리 불가능할 정도로 망가졌다고 주장하는 것이 아니라, 이전에 완전히 다뤄지지 않은 특정 유형의 고효율 기만에 현재 취약하다는 점을 지적하는 것입니다. 저자들은 이러한 시스템을 보호하기 위해 견고한 방어 체계와 탐지 메커니즘을 개발하는 것이 시급한 다음 단계라고 결론지었습니다. 그들은 이러한 안전장치 없이는 3D 파운데이션 모델의 급격한 도입이 핵심 인프라를 새롭고 위험한 리스크에 노출시켜, 미세하고 보이지 않는 신호가 현실 세계에서 기계를 길을 잃게 만드는 상황을 초래할 수 있다고 제언합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →