← 최신 논문
💻 computer science

Multi-view Patch Inference with Frozen DINOv3 for Industrial Anomaly Detection

본 논문은 경계 정보의 손실을 극복하기 위한 다중 뷰 패치 추론(Multi-view Patch Inference) 전략과 정상 특징 분포를 모델링하기 위한 다중 스케일 재구성 융합 트랜스포머(Multi-scale Reconstruction Fusion Transformer)를 결합한 고정된 DINOv3 백본 기반의 산업용 이상 탐지 프레임워크를 제안하며, 이를 통해 여러 벤치마크 데이터셋에서 최첨단 성능을 달성한다.

원저자: Chaoqun Wang, Wenjing Zhang, Bo Qi, Xiaoyu Huang, Ning He

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chaoqun Wang, Wenjing Zhang, Bo Qi, Xiaoyu Huang, Ning He

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 공장의 품질 검사관이라고 상상해 보세요. 하지만 눈으로 컨베이어 벨트를 보는 대신, 나사, 칩, 직물 같은 제품에서 아주 작은 스크래치, 균열, 또는 이상한 돌출부를 찾아내기 위해 초지능형 로봇 두뇌를 사용하고 있습니다. 목표는 결함이 있는 제품의 사진을 수백만 장 먼저 보여주지 않고도 이러한 "이상 징후(anomalies)"를 찾아내는 것입니다.

오랫동안 최고의 로봇 두뇌(Vision Transformer라고 불림)들은 매우 뛰어났지만, 까다로운 사각지대를 가지고 있었습니다. 로봇이 이미지를 격자 모양의 정사각형 타일로 조각내어 본다고 상상해 보세요. 만약 아주 작은 스크래치가 두 타일이 만나는 경계선에 딱 걸쳐 있다면, 로봇은 각 정사각형의 "전체적인 모습"을 파악하는 데 집중하느라 이를 놓칠 수도 있습니다. 이는 마치 보도블록의 중심만 보고 길의 균열을 찾는 것과 같습니다. 만약 균열이 블록의 가장자리에 있다면, 당신은 그냥 지나칠 수도 있습니다.

핵심 아이디어: "중첩된 시선 (The Overlapping Gaze)"
Chaoqun Wang과 그의 팀이 이끄는 저자들은 **다중 뷰 패치 추론(Multi-view Patch Inference, MVPI)**이라는 영리한 기술로 이 사각지대를 해결하기로 했습니다.

이미지를 깔끔한 하나의 격자로 나누는 대신, 그들은 로봇이 동일한 이미지를 여러 번 보게 하되, 매번 격자를 약간씩 이동시킵니다. 이것은 그림을 찍은 뒤, 이번에는 왼쪽으로 아주 조금 움직여서 다시 찍고, 또 이번에는 오른쪽으로 움직여서 찍는 것과 같습니다. 이제, 첫 번째 뷰에서 타일의 가장자리에 걸쳐 있던 작은 스크래치는 두 번째 뷰에서는 타일의 중앙에 안전하게 위치하게 됩니다. 로봇은 이 중첩된 뷰들을 모두 살펴보고 그 결과들을 결합합니다. 이렇게 하면 어떤 결함도 더 이상 "사각지대" 선에 갇히지 않게 됩니다.

"메모리가 없는" 두뇌
보통 이러한 로봇들은 자신이 보는 것과 비교하기 위해 "정상" 이미지들이 담긴 거대한 라이브러리(메모리 뱅크)를 가지고 다녀야 합니다. 이는 무겁고 느립니다. 저자들은 그런 무거운 라이브러리를 들고 다닐 필요가 없다고 주장합니다. 대신, 그들은 DINOv3라고 불리는 얼려진(frozen), 사전 학습된 두뇌를 사용합니다. DINOv3를 이미 수십억 개의 이미지를 보아서 무엇이 "정상"인지 이미 알고 있는 천재 예술 학생이라고 생각해보세요. 이 학생은 물리적인 사진첩을 들고 다닐 필요 없이도 정상의 모습을 알고 있습니다.

그들은 이 두뇌를 고정(freeze)하여(새로운 것을 배우며 혼란스러워하지 않도록 함) 특징을 추출하는 데만 사용합니다. 그런 다음, **다중 스케일 재구성 융합 트랜스포머(Multi-scale Reconstruction Fusion Transformer, MRFT)**라는 가벼운 도구를 사용합니다. 이 도구는 천재적인 두뇌가 본 것을 바탕으로 "정상적인" 버전의 이미지를 재구성하려고 시도합니다. 만약 로봇이 완벽한 나사의 사진을 재구성하려고 하는데 실제 이미지에 스크래치가 있다면, 그 지점의 재구성은 흐릿하거나 잘못되어 보일 것입니다. "완벽한" 재구성과 "실제" 이미지 사이의 차이가 클수록, 결함일 가능성이 높습니다.

그들이 발견한 것 (그리고 발견하지 못한 것)
팀은 이 아이디어를 세 가지 다른 산업용 이미지 세트에서 테스트했습니다:

  1. MVTec AD: 병, 케이블, 가죽 등 15개 카테고리가 포함된 표준 테스트 세트입니다.
  2. BTAD: 실제 공장의 노이즈와 조명 문제가 포함된 세트입니다.
  3. UltraChip: 배경 노이즈가 매우 심한 반도체 칩의 미세 결함을 다루는 매우 어려운 세트입니다.

결과:

  • UltraChip 데이터셋에서: 이 방법은 81.9%의 평균 Image-AUC를 달성했습니다. 이는 로봇이 좋은 칩과 나쁜 칩을 얼마나 잘 구별하는지를 측정하는 점수입니다. 이들은 이 결과가 URD나 SuperSimpleNet 같은 다른 상위 방법들보다 우수함을 확인했습니다.
  • MVTec AD 데이터셋에서: 이미지 레벨 탐지에서 99.5%, 픽셀 레벨 탐지(결함이 있는 위치를 정확히 짚어내는 것)에서 **99.2%**를 기록했습니다. 이는 Dinomaly나 Subspace 같은 강력한 경쟁자들을 앞선 수치입니다.
  • BTAD 데이터셋에서: 평균 97.3%의 Image-AUC를 기록하며 일관된 우위를 유지했습니다.

그들이 명시적으로 배제한 것
논문은 수천 개의 이미지 특징을 저장하는 무겁고 복잡한 메모리 뱅크를 사용하는 것에 반대하며, 이것이 비용이 많이 들고 느리다고 언급했습니다. 또한, 단일 격자 타일 방식을 사용하는 것에 반대하며, 이 방식이 경계면에서의 결함을 놓친다는 것을 보여주었습니다. 그들은 단순히 추측한 것이 아니라 측정했습니다. 예를 들어, "나사(screw)" 카테형에서 단일 격자를 사용했을 때 점수가 떨어졌지만, 그들의 중첩된 뷰를 사용했을 때 점수가 상승했음을 보여주었습니다.

얼마나 확신하는가?
저자들은 단순히 만들어낸 시뮬레이션이 아니라 실제 벤치마크 데이터셋에서 테스트했기 때문에 이 수치들에 대해 상당히 자신감이 있습니다. 그들은 자신의 방법이 "가볍다"고 말하면서도, 거대한 DINOv3 두뇌를 사용하는 것은 여전히 어느 정도의 컴퓨팅 파워가 필요하므로 즉각적이지는 않다고 언급합니다. 흥-미롭게도, 논문은 이 방법이 UltraChip 데이터셋에서 유망한 제로샷 일반화 행동을 보인다고 언급하며, 이는 다중 뷰 특징 집계와 얼려진 비전 트랜스포머의 결합이 암묵적으로 전이 가능한 정상성 사전 지식(normality priors)을 포착할 수 있음을 시사한다고 설명합니다. 그러나 저자들은 현재의 프레임워크가 여전히 전통적인 단일 클래스 학습 패러다임 하에서 작동한다는 점을 명확히 하고 있습니다. 즉, 현재는 제품 카테고리별로 별도의 모델을 학습시켜야 하며, 진정한 의미의 제로샷 시스템은 아니라는 것입니다. 이 관찰은 향후 프레임워크를 제로샷 또는 퓨샷(few-shot) 시나리오로 확장할 수 있는 흥미로운 방향을 열어줍니다.

결론
이미지를 여러 겹 겹쳐진 각도에서 바라보고, 사전 학습된 스마트한 두뇌를 사용하여 무엇이 맞지 않는지를 찾아냄으로써, 팀은 이전 방식들보다 작고 까다로운 결함을 더 잘 찾아내는 시스템을 만들었습니다. 이는 마치 검사관에게 초점을 아주 살짝씩 옮겨가며 어떤 균열도 놓치지 않게 해주는 안경을 쥐여주는 것과 같으며, 동시에 검사관의 배낭을 충분히 가볍게 유지하여 빠르게 달릴 수 있게 해주는 것과 같습니다.

이 시스템의 코드는 누구나 확인할 수 있도록 공개되어 있으며, 저자들은 이 시스템을 더 빠르게 만들고 동시에 다양한 종류의 제품을 처리할 수 있도록 계속 연구할 계획입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →