← 최신 논문
💻 computer science

FreqPrompt-AD: Frequency-guided local semantic prompting for zero-shot industrial anomaly detection and segmentation

본 논문은 CLIP 스타일 모델의 전역적 이미지-텍스트 정렬의 한계를 극복하기 위해 주파수 유도 국소 의미론적 프롬프팅을 활용함으로써 제로샷 산업 이상 탐지 및 분할 성능을 향상시키는 학습이 필요 없는 프레임워크인 FreqPrompt-AD를 제안하며, 이를 통해 여러 벤치마크에서 최첨단 성능을 달성한다.

원저자: Siqi Qiao, Chang Liu

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siqi Qiao, Chang Liu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 공장의 품질 검사관이라고 상상해 보세요. 당신의 업무는 금속 기어, 회로 기판, 또는 천과 같은 제품에서 아주 작은 스크래치, 균열, 또는 얼룩을 찾아내는 것입니다. 그런데 문제는, 당신은 이 특정 유형의 제품을 한 번도 본 적이 없다는 것입니다. 무엇이 "불량"인지 알려주는 매뉴얼이나 목록도 없습니다. 그저 사진 한 장을 보고 "이 부분이 이상해 보인다"라고 말해야 합니다.

이것이 바로 **제로샷 산업용 이상 탐지(Zero-Shot Industrial Anomaly Detection)**의 과제입니다. 이 논문은 이를 해결하기 위해 FreqPrompt-AD라는 새로운 도구를 소개합니다.

작동 원리는 다음과 같습니다. 쉬운 비유를 통해 설명해 드리겠습니다.

문제점: "전체적인 모습" vs "미세한 스크래치"

연구진은 현대의 AI 모델(VLM이라 불리는 시각-언어 모델)이 범용적인 미술 비평가와 같다는 점에 주목했습니다. 이들은 전체 그림을 보고 "이것은 풍경화입니다" 또는 "이것은 초상화입니다"라고 말하는 데 매우 능숙합니다. 즉, "전체적인 모습"을 아주 잘 이해합니다.

하지만 산업 현장의 결함은 종-종 머리카락 같은 미세한 균열이나 먼지 입자처럼 아주 작고 고주파적인 세부 사항입니다. 범용적인 미술 비평가에게 금속 표면의 작은 스크래치를 찾아달라고 요청하면, 그들은 이를 놓치기 쉽습니다. 그들은 물체의 전체적인 형태(예: "저것은 기어다")에 너무 정신이 팔려 미세한 질감의 변화를 무시하게 됩니다.

논문에 따르면 결함이 있는 영역은 "노이즈"가 더 많으며(고주파 에너지가 더 높음), 일반적인 AI 모델은 차분하고 일관되게 유지하도록 훈련되었기 때문에 이러한 노이즈를 뭉개버리는 경항이 있습니다.

해결책: FreqPrompt-AD

저자들은 정확히 어디를 봐야 할지 아는 특수 탐정과 같은 시스템을 구축했습니다. 단순히 AI에게 "이 물체가 고장 났나요?"라고 묻는 대신, 문제 지점을 찾기 위한 3단계 전략을 제공합니다.

1. "정적 필터" (주파수 인지 프롬프트 상호작용)

당신이 노래를 듣고 있다고 상상해 보세요. 때때로 음악은 부드럽지만, 레코드판의 스크래치는 날카롭고 높은 음의 하는 소리나 치익 하는 잡음을 만들어냅니다.

  • 논문의 방식: 이미지를 가져와서 "부드러운 음악"(저주파 배경)과 "잡음"(고주파 세부 사항)으로 분리합니다.
  • 비유: AI에게 이렇게 말하는 것입니다. "이미지의 부드러운 부분은 무시하세요. 오직 '잡음이 섞인 듯'하거나 '거친' 느낌이 드는 영역에만 집중하세요. 그곳이 결함이 숨어있을 가능성이 높은 곳입니다." 이는 보이지 않는 질감의 변화를 AI를 위한 스포트라이트로 바꿔줍니다.

2. "로컬 사서" (로컬 시맨틱 캘리브레이션)

때로는 그 "잡음"이 결함이 아니라, 단순히 물체의 자연스러운 가장자리(예: 컵의 테두리)일 수도 있습니다. 만약 AI가 노이즈만 찾는다면 혼란을 겪을 수 있습니다.

  • 논문의 방식: 이 특정 이미지를 위한 "정상 프로토타입"을 만듭니다. 이미지의 깨끗하고 안전한 부분들을 살펴보고 이렇게 말합니다. "좋아, 바로 여기에서의 '정상'은 이런 모습이야."
  • 비유: 이것은 특정 선반에 있는 "깨끗한 책"이 무엇인지 정확히 알고 있는 사서와 같습니다. 만약 어떤 책에 이상한 얼룩이 있다면, 사서는 일반적인 책의 정의가 아니라, 그 선반에 있는 다른 깨끗한 책들과 비교하여 판단합니다. 이를 통해 AI가 물체의 자연스러운 형태 때문에 혼란을 겪는 것을 방지합니다.

3. "최종 판결" (텍스트 기반 결정)

이제 AI는 두 가지 증거를 갖게 되었습니다:

  1. "이 영역은 노이즈가 많다/잡음이 섞여 있다" (1단계로부터)
  2. "이 영역은 이 특정 이미지의 깨끗한 부분들과 다르다" (2단계로부터)
  • 논문의 방식: 이 단서들을 AI가 원래 알고 있던 "고장"의 의미(텍스트 프롬프트)와 결합합니다.
  • 비유: 이는 증거를 검토하는 판사와 같습니다. "정적 필터는 '수상함'을 가리키고, 로컬 사서는 '이례적임'을 가리키며, 텍스트 프롬프트는 '이것이 결함의 설명과 일치함'을 나타냅니다. 따라서, 결함이 존재합니다."

결과

연구진은 네 가지 산업 데이터셋(MVTec AD, VisA, BTAD, MPDD)을 통해 테스트를 진행했습니다.

  • "학습이 필요 없는(Training-Free)" 버전: 이 시스템은 특정 공정 라인에 대해 따로 학습할 필요 없이 완벽하게 작동합니다. 사전 훈련된 AI와 위의 세 단계를 그대로 사용합니다. 이 버전은 다른 모든 유사한 "제로샷" 방법들을 능가했습니다.
  • "어댑터(Adapter)" 버전: 그들은 또한 정상 이미지로부터 아주 조금만 학습하는 작고 가벼운 추가 기능(마치 작은 플러그인처럼)을 만들었습니다. 이 버전은 훨씬 더 뛰어난 성능을 보이며 전체적으로 가장 높은 점수를 기록했지만, 여전히 거대한 AI의 뇌를 다시 훈련할 필요는 없었습니다.

왜 중요한가

이 논문은 이것이 수천 장의 훈련 사진을 먼저 수집할 필요 없이 새로운 제품의 결함을 찾아내는 현재 가장 우수한 방법이라고 주장합니다. 이 모델이 성공적인 이유는 AI가 단순히 물체의 형태를 바탕으로 "추측"하는 것을 멈추게 하고, 실제 손상이 숨어있는 질감과 주파수 세부 사항을 보도록 강제하기 때문입니다.

요약하자면: FreqPrompt-AD는 범용 AI에게 배경을 위한 "노이즈 캔슬링 헤드폰"을 쓰고, 결함을 위한 "고주파 안경"을 쓰도록 가르쳐서, 다른 모델들이 놓치는 미세한 균열과 스크래치를 찾아낼 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →