← 최신 논문
💻 computer science

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

PADFormer는 계산 비용이 많이 드는 3D 재구성을 필요로 하지 않으면서도, 교차 뷰 마스크 재구성(cross-view masked reconstruction)과 앙상블 추론을 통해 희소한 뷰로부터 이상 없는 이미지를 재구성하기 위해 비전 트랜스포머를 활용하는, 포즈에 무관한 이상 탐지를 위한 새롭고 효율적인 이미지 공간 접근 방식입니다.

원저자: Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

게시일 2026-08-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 공장의 품질 검사관이라고 상상해 보세요. 하지만 고정된 위치에 서 있는 것이 아니라, 수천 개의 작은 부품으로 만들어진 거대하고 회전하는 조각상 주변을 떠다니고 있습니다. 당신의 임무는 단 하나의 스크래치나 빠진 볼트를 찾아내는 것입니다. 문제는 조각상이 회전하고 있으며, 때로는 뒤집히거나 옆으로 누워 있고, 다른 부품 뒤에 일부를 숨기기도 한다는 점입니다. 컴퓨터 비전의 세계에서 이것은 **이상 탐지(Anomaly Detection)**라는 과제입니다. 즉, '완벽한' 아이템의 사진만을 사용하여 결함을 찾아내도록 컴퓨터를 가르치는 것입니다. 보통 컴퓨터는 경직된 로봇과 같습니다. 그들은 물체가 매번 정확히 같은 포즈에 있기를 기대합니다. 만약 그들에게 정면에서 본 완벽한 컵을 보여주면, 그들은 앞면에 있는 금을 찾아낼 수 있습니다. 하지만 컵이 이상한 각도에서 찍혔거나 옆면에 금이 간 경우라면, 로봇은 혼란에 빠집니다. 왜냐하면 그 각도에서 본 컵을 본 적이 없기 때문입니다. 여기서 **포즈 불가지론적 이상 탐지(Pose-Agnostic Anomaly Detection)**가 등장합니다. 이는 "물체가 어떻게 뒤틀리거나 회전하더라도 컴퓨터가 부서진 부분을 찾을 수 있는가?"를 의미하는 멋진 표현입니다.

오랫동안 이를 해결하는 유일한 방법은 물체의 완전한 3D 홀로그램을 구축하는 것이었습니다. 예를 들어, 장난감을 가능한 모든 각도에서 찍은 수백 장의 사진을 찍어 슈퍼컴퓨터에 입력하고, 가상의 3D 모델을 만든 다음, 그 모델을 회전시켜 새로운 사진과 대조하며 무엇이 잘못되었는지 확인하는 식입니다. 작동은 하지만, 이는 마치 조약돌 하나를 찾기 위해 모래성으로 집을 짓는 것과 같습니다. 시간이 엄청나게 오래 걸리고, 방대한 데이터가 필요하며, 비용이 매우 많이 듭니다. 이 논문의 연구자들은 더 단순한 질문을 던졌습니다. 3D 모델이 전혀 필요 없다면 어떨까? 이 이상한 각도에서의 완벽한 물체 모습이 2D 사진 속에서 바로 어떻게 보일지 그냥 '상상'할 수 있다면 어떨까?

여기에 PADFormer라는, 마치 초강력한 미술품 복원가처럼 행동하는 새로운 방법이 등장합니다. 3D 모델을 만드는 대신, PADFormer는 완벽한 물체의 사진 몇 장(예: 2~10장)과 결함이 있을지도 모르는 새로운 사진을 살펴봅니다. 그런 다음, **비전 트랜스포머(Vision Transformer)**라고 불리는 특수한 유형의 AI(이미지를 아주 작은 퍼즐 조각으로 나누어 보는 뇌라고 생각하세요)를 사용하여 '빈칸 채우기' 게임을 수행합니다. 컴퓨터는 새 사진을 가져와서, 사진의 무작ful한 패치들을 가린 후(그림 위에 포스트잇을 붙이는 것처럼), 보고 있는 '완벽한' 사진들을 사용하여 그 누락된 부분을 다시 그려내려고 시도합니다. 이 컴퓨터는 오직 완벽한 물체들로만 훈련되었기 때문에, 부서진 부분을 그리는 법을 모릅니다. 따라서 포스트잇을 떼고 빈칸을 채울 때, 컴퓨터는 그 자리에 대한 '완벽한' 버전을 그려냅니다. 만약 원래 사진에 스크래치나 누락된 부분이 있었다면, 컴퓨터의 그림은 실제 사진과 다르게 보일 것입니다. 이 두 가지를 비교함으로써, 컴퓨터는 물체가 이전에 본 적 없는 방식으로 뒤틀려 있더라도 즉각적으로 결함을 찾아냅니다.

이 논문은 이 접근 방식이 효율성 측면에서 게임 체인저임을 입증합니다. 기존 방법들이 작동하기 위해 수백 장의 사진과 복잡한 3D 재구성이 필요했던 반면, PADFormer는 단 몇 장의 참조 이미지(최소 2장)만으로 최첨단(state-of-the-art) 결과를 달성합니다. MAD-SIM 및 PIAD와 같은 데이터셋 테스트에서 PADFormer는 이전 방법들을 크게 압도했습니다. 예를 들어, '2-샷(2-shot)' 시나리오(두 장의 참조 이미지만 사용)에서, PAD former는 이미지 레벨 정확도 점수 78.8을 기록하여 차순위 방법의 57.9를 앞질렀습니다. 또한 픽셀 단위로 결함을 찾아내는 점수에서도 89.2를 기록하며 경쟁 모델들을 큰 격차로 따돌렸습니다. 저자들은 이 방식이 이상한 각도뿐만 아니라 물체가 고정된 위치에 있는 표준 작업에서도 잘 작동한다는 것을 보여줌으로써, 그들의 방법이 다재다능함을 증명했습니다.

비결은 PADFormer가 "퍼즐 조각"을 처리하는 방식에 있습니다. 단순히 전체 사진을 보는 것이 아니라, 동적 패치 선택(Dynamic Patch Selection) 메커니즘을 사용합니다. 찢어진 지도를 고치려고 한다고 상상해 보세요. 지도 전체를 보는 대신, 다른 지도의 특정 모퉁이가 찢어진 부분에 완벽하게 들어맞는 것을 찾는 것과 같습니다. PADFormer는 수학적으로 이를 수행하며, '완벽한' 참조 패치를 '부서진' 쿼리 패치에 정렬한 다음 내용을 채워 넣습니다. 또한 **이상 불가지론적 토큰(Anomaly-Agnostic Tokens)**이라는 특수한 '메모리 뱅크'(정상적인 모습이 국소적/전역적으로 어떻게 생겼는지에 대한 학습된 힌트)를 사용하여, 물체가 뒤집혀 있더라도 올바른 형태를 추측하도록 돕습니다.

결정적으로, 이 논문은 3D 재구성의 필요성을 배제합니다. 저자들은 모든 개별 품목에 대해 수백 장의 사진을 찍어야 하는 실제 공장 환경에서, 무거운 작업을 수행하는 3D 모델 구축은 불필요하며 비현실적이라고 주장합니다. 또한 그들은 다른 방법들이 물체가 완벽하게 정렬되어 있을 때는 잘 작동할 수 있지만, 관점이 변하면 처참하게 실패한다는 점을 보여줍니다. 반면, PADFormer는 바로 이러한 혼돈을 위해 설계되었습니다. 단순히 추측하는 것이 아니라, 2D 공간에서 직접 '이상적인' 이미지 버전을 재구성하는 법을 배웁니다.

실험에서 연구자들은 PADFormer가 정확할 뿐만 아니라 빠르다는 것을 발견했습니다. 재구성 과정을 여러 번(구체적으로 서로 다른 무작위 마스크를 사용한 15번의 패스) 실행하고 결과를 평균 내는 방식을 통해, 시스템은 이미지의 모든 구석을 빠짐없이 확인합니다. 또한, 원본 이미지와 재구성된 이미지 사이의 차이를 인간의 눈이 색을 보는 방식과 유사한 CIELAB 색 공간에서 측정하는 것이 표준 RGB 색상을 사용하는 것보다 더 효과적이라는 것을 발견했습니다. 이를 통해 다른 방법들이 놓칠 수 있는 미세한 얼룩이나 버(burr) 같은 미세한 결함까지 잡아낼 수 있었습니다.

논문은 결론적으로, PADFormer가 고도의 기술을 요하는 3D 방식과 단순한 2D 이미지 처리 사이의 간극을 메운다고 설명합니다. 우리는 부서진 장난감을 찾기 위해 가상 세계를 구축할 필요가 없으며, 단지 모든 각도에서 완벽한 장난감이 어떻게 생겼는지 아는 똑똑한 화가가 있으면 된다는 것을 시사합니다. 비록 이 방법에도 한계(전체적인 그림을 얻기 위해 여러 번의 패스가 필요하거나, 매우 큰 결함에는 어려움을 겪을 수 있음 등)는 있지만, 이는 중요한 진전입니다. 적절한 '상상력'만 있다면, 컴퓨터가 세상이 아무리 빙글빙글 돌아가더라도 이상한 것과 부서진 것을 찾아낼 수 있다는 것을 증명했기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →