← 최신 논문
💻 computer science

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

본 논문은 참조 인지형 교사(reference-aware teacher)를 활용하여 미세한 이상 탐지를 유도함으로써 참조 기반 비교의 이점을 쿼리 전용 학생 모델에 내재화하는 참조 특권 온-폴리시 증류 프레임워크인 ADOPD를 제안하며, 이를 통해 MMAD 벤치마크에서 최첨단 제로샷 성능을 달성한다.

원저자: Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 해결하고 있다고 상상해 보세요. 하지만 범죄 현장 대신, 당신이 보고 있는 것은 공장 바닥입니다. 당신의 임무는 반짝이는 새 제품에 있어서는 안 될 아주 작은 흠집을 찾아내는 것입니다. 이것이 바로 **산업 이상 탐지(Industrial Anomaly Detection)**의 세계입니다. 오랫동안 컴퓨터는 이 분야에서 형편없는 성적을 보여왔는데, 그 이유는 컴퓨터가 일반적인 의미에서의 '정상'은 알지만, 라인에서 쏟아져 나오는 개별 제품 각각의 특수한 특징까지는 알지 못하기 때문입니다.

여기에 **멀티모달 거대 언어 모델(MLLM)**이 등장합니다. 이들을 시각과 텍스트를 동시에 읽을 수 있는 초스마트 AI 탐정이라고 생각해보세요. 이들은 추론 능력은 뛰어나지만, 결함을 잡아내는 데 필요한 아주 작고 구체적인 세부 사항은 놓치는 경우가 많습니다. 보통, 이 AI 탐정들을 돕기 위해 인간은 그들에게 '참조 사진'—즉, 결함이 없는 완벽한 제품의 사진—을 제공하여 의심스러운 제품과 비교하게 합니다. 이는 마치 탐정에게 완벽한 지문의 사진을 보여주어 실제 지문에 있는 얼룩을 찾아내게 하는 것과 같습니다. 하지만 모든 아이템마다 이 작업을 수행하는 것은, 결출을 볼 때마다 단서를 찾기 위해 도서관으로 달려가야 하는 것처럼 느리고 계산 비용이 많이 드는 일입니다. 연구자들이 던진 핵심 질문은 이것이었습니다: AI가 참조 사진을 매번 찾아보지 않고도, 완벽한 참조 이미지가 어떻게 생겼는지 기억하도록 가르칠 수 있을까?

여기서 ADOPD라는 영리한 훈련법을 제안하는 새로운 연구가 등장합니다. 연구진은 이미지 간의 직접적인 비교가 주는 이점을 AI의 뇌 속에 훈련 과정 중에 '내재화'할 수 있는지 확인하고 싶었습니다. 그들은 단순히 AI가 정답을 암기하는 것이 아니라, 사물을 검사하는 방법을 배우기를 원했습니다.

연구팀은 **선생님(Teacher)**과 **학생(Student)**이라는 두 캐릭터를 설정한 훈련 시나리오를 구성했습니다. 선생님은 매우 똑똑한 AI로, 의심스러운 아이템과 완벽한 참조 사진을 모두 볼 수 있습니다. 학생은 우리가 나중에 실제로 사용하고자 하는 AI이며, 의심스러운 아이템만을 봅니다. 목표는 학생이 참조 사진 없이도 선생님처럼 똑똑하게 행동하도록 만드는 것입니다.

하지만 까다로운 점이 있습니다. 선생님이 너무 똑똑할 수도 있다는 것입니다. 선생님은 자신이 수행해야 할 구체적인 비교를 무시한 채, 단지 읽고 있는 텍스트나 이미지의 전반적인 분위기만 보고 정답을 맞힐 수도 있습니다. 이를 해결하기 위해 연구진은 선생님을 위한 '틀린 그림 찾기' 게임을 발명했습니다. 그들은 선생님에게 학생의 추측을 두 번 보여주었습니다. 한 번은 올바른 참조 사진과 함께 보여주는 '매치(Matched)' 뷰이고, 다른 한 번은 잘못된 참조 사진과 함께 보여주는 '미스매치(Mismatched)' 뷰입니다.

만약 선생님이 정말로 참조 사진을 중요하게 여긴다면, 올바른 사진을 보았을 때는 확신이 치솟고, 잘못된 사진을 보았을 때는 확신이 떨어져야 합니다. 연구진은 이 차이를 이용하여 특별한 '신뢰도 점수'를 만들었습니다. 만약 선생님이 잘못된 사진 때문에 확신을 가졌다면, 학생은 그 단서를 무시하도록 배웁니다. 만약 선생님이 올바른 사진 때문에 확신을 가졌다면, 학생은 그 부분에 주의를 기울이도록 배웁니다. 이 과정을 **참조 특권 온폴리시 증류(Reference-Privileged On-Policy Distillation)**라고 부릅니다. 이는 마치 코치가 선수의 연습을 지켜보는 것과 같은데, 코치는 선수가 단순히 추측하는 것이 아니라 실제로 올바른 기술을 사용하고 있을 때만 피드백을 주는 것과 같습니다.

결과는 이 방법이 놀라울 정도로 잘 작동한다는 것을 보여줍니다. 다양한 종류의 산업 검사 작업 7가지를 포함하는 MMAD 벤치마크에서 테스트했을 때, 이 새로운 방법은 평균 **77.31%**의 정확도를 달 achieved 했습니다. 이는 베이스 모델보다 6.14 포인트 향상된 수치입니다. 더욱 인상적인 것은, 테스트 중에 참조 사진을 전혀 보지 못한 이 AI가 참조 사진을 볼 수 있었던 경우(원샷 설정)보다 더 높은 성능을 보였다는 점이며, 정확도 면에서 원샷 설정을 2.64 포인트 앞질렀습니다. 그러나 연구는 트레이드오프(trade-off)가 존재한다고 언급합니다. 즉, 이 새로운 방법은 더 많은 결함을 찾아냈지만(높은 재현율), 잘못된 경보를 울릴 가능성도 약간 높아져 원샷 설정에 비해 정밀도가 소폭 하락했습니다.

이 연구는 "매치 vs 미스매치" 훈련 기법을 통해 AI가 결함을 포착하는 미세한 전략을 학습했음을 시사합니다. AI는 단순히 사실을 암기한 것이 아니라, 중요한 시각적 차이점을 찾는 법을 배웠습니다. 연구진은 이 접근 방식이 단순히 카테고리를 추측하는 것이 아니라, 결함이 어디에 있고 어떤 종류의 이상인지 파악하는 데 특히 유용하다는 것을 발견했습니다. 현재 이 방법은 훈련을 위해 쌍을 이룬 이미지와 특정 주석(annotation)을 필요로 하지만, 이번 연구 결과는 우리가 AI에게 더 날카롭고 자립적인 검사관이 되어, 매번 참조를 확인하지 않고도 아주 작은 결함까지 찾아낼 수 있도록 가르칠 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →