DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection
DriftAD는 시각적 가이드 텍스트 드리프트(Visually-Guided Text Drift) 메커니즘을 도입하여 공간 및 레이어별 적응형 이상 징후 기술자(anomaly descriptors)를 동적으로 생성함으로써 정적 텍스트 프롬프트의 한계를 극복하고 MVTec-AD 및 VisA 데이터셋에서 탐지 성능을 크게 향상시킨 퓨샷(few-shot) 산업용 이상 탐지 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대적인 자동화 제조의 광활한 세계에서, 제품을 완벽하게 유지하는 것은 보이지 않는 존재와의 끊임없는 싸움입니다. 기계는 매시간 수천 개의 동일한 품목을 조립하지만, 금속 표면에 아주 작은 흠집이 나타나거나 직물에 미세한 변색이 생기는 순간, 전체 배치가 실패할 위험에 처합니다. 수십 년 동안 컴퓨터는 이러한 결함을 발견하는 데 어려움을 겪어 왔는데, 이는 결함이 드물고 예측 불가능하기 때문입니다. 전통적인 방식은 컴퓨터에게 모든 종류의 제품에 대해 '정상'이 무엇인지 인식하도록 가르쳐야 했으며, 이는 매우 느리고 비용이 많이 드는 과정이었고 새로운 품목이 공장에 도입되자마자 무너졌습니다. 최근에는 이미지와 언어를 모두 이해하도록 원래 훈련된 인공지능 모델을 사용하는 새로운 접근 방식이 등장했습니다. 이 모델들은 "손상된 병"과 같은 설명을 읽고 사진 속에서 이를 찾아낼 수 있어, 수천 개의 사례를 필요로 하지 않고도 결함을 찾는 유연한 방법을 제공합니다. 그러나 이러한 첨단 시스템조차도 사각지대를 가지고 있습니다. 이들은 결함을 하나의 통일된 개념으로 취급하는 경향이 있어, 결함이 이미지 데이터의 어디에 위치하느냐 또는 얼마나 깊게 자리 잡고 있느냐에 따라 다르게 보일 수 있다는 점을 인지하지 못합니다.
난양 공과대학교와 화중과기대학교의 연구진은 바로 이 특정 약점을 해결하기 위해 'DriftAD'라고 불리는 새로운 시스템을 개발했습니다. 2026년 ACM 멀티미디어 국제 컨퍼런스(ACM International Conference on Multimedia)를 위해 발표된 이들의 연구는, 컴퓨터가 이미지의 서로 다른 부분을 살펴볼 때 결함에 대한 이해를 동적으로 '표류(drift)'시키거나 변화시키는 방법을 소개합니다. 결함에 대해 고정된 단일 설명을 사용하는 대신, DriftAD는 그 설명이 이미지의 국소적인 시각적 맥락에 따라 변할 수 있도록 허용합니다. 보안 요원이 군중 속의 용의자에 대한 단 하나의 경직된 묘사만을 들고 있는 것이 아니라, 조명, 거리, 각도를 고려하여 다양한 구역을 스캔할 때마다 머릿속의 용의자 이미지를 실시간으로 조정하는 것을 상상해 보십시오. 이와 마찬가지로, 이 새로운 방법은 결함에 대한 고정되고 변하지 않는 텍스트 설명을 가져와서, 현재 조사 중인 영역의 구체적인 시각적 세부 사항에 맞춰 그 설명을 부드럽게 조정합니다.
과정은 컴퓨터의 이미지 시야를 날카롭게 다듬는 것으로 시작됩니다. 시스템은 먼저 특화된 분기(branches)를 사용하여 정상적인 제품의 지배적인 패턴에 의해 숨겨질 수 있는 미세한 신호들을 강조합니다. 시스템은 공간적 렌즈를 통해 각 작은 패치를 인접한 이웃들과 비교하여 편차를 찾아내고, 주파수 렌즈를 통해 이미지의 근본적인 패턴을 분석함으로써 눈이 놓칠 수 있는 불규칙성을 포착합니다. 이러한 희미한 결함 신호들이 증폭되면, 시스템은 핵심 혁신 기술인 '시각 유도 텍스트 표류(Visually-Guided Text Drift)'를 실행합니다. 여기서 컴퓨터는 이상 징قت에 대한 표준 텍스트 설명을 가져와, 방금 증폭시킨 시각적 특징들에 의해 유도되어, 분석의 모든 단계마다 새로운 맞춤형 버전으로 변환합니다. 이는 컴퓨터가 넓은 형태에서부터 미세한 질감에 이르기까지 이미지의 층을 하나씩 벗겨 나갈 때, 무엇이 '결함'을 구성하는지에 대한 정의가 특정 규모와 위치에 맞게 진화함을 의미합니다.
이러한 변화하는 설명들이 유용하게 쓰일 수 있도록, 시스템은 이들을 이미지를 다시 스캔하는 탐침(probe)으로 사용합니다. 시스템은 시각적 특징에 "이 이미지의 부분이 현재의 맞춤형 결함 설명과 일치하는가?"라고 묻습니다. 만약 답이 '예'라면 해당 부분은 강조되고, 그렇지 않다면 무시됩니다. 이를 통해 시스템은 문제의 위치를 파악하는 매우 집중된 지도를 생성하며, 배경의 노이즈를 걸러냅니다. 연구진은 금속 너트부터 케이블, 카펫에 이르기까지 다양한 제품의 수천 장의 이미지를 포함하는 두 가지 주요 산업 데이터셋인 MVTec-AD와 VisA를 통해 이 접근 방식을 테스트했습니다. 그들은 시스템에 완벽한 제품의 사례를 단 하나, 둘, 혹은 네 개만 제공하여 학습시키는 '퓨샷 러닝(few-shot learning)' 상황을 부여하며 도전 과제를 던졌습니다.
결과는 결정적이었습니다. 결함이 있는 이미지를 식별하고 결함의 정확한 위치를 짚어내는 능력을 측정하는 테스트에서, DriftAD는 모든 설정에서 기존의 모든 방법을 능가했습니다. MVTec-AD 데이터셋에서 이 시스템은 단 하나의 사례만으로 97.2%의 이미지 수준 정확도와 96.8%의 픽셀 수준 정밀도를 달s성했습니다. 더 복잡하고 다양한 결함을 특징으로 하는 VisA 데이터셋에서는 이미지 탐지에서 93.1%, 결함의 특정 픽셀을 찾는 데 있어 97.4%의 정확도를 기록했습니다. 이 수치들은 이전의 최고 방법들을 명확한 차이로 앞지르는 상당한 도약을 의미합니다. 이 연구는 이미지를 경직된 설명에 맞추려 하기보다, 결함의 텍스트 설명을 이미지의 시각적 실체에 따라 움직이고 적응하게 함으로써, 기계가 이전에는 도달할 수 없었던 수준의 정밀도로 산업적 결함을 탐지할 수 있음을 확인시켜 줍니다. 이 접근 방식은 새로운 제품을 위해 전체 시스템을 재학습할 필요가 없어, 현대 제조업의 역동적인 요구에 부합하는 확장 가능한 솔루션이 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.