OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
OmniAD는 텍스트 기반 마스크 인코딩과 시각적 유도 추론을 활용하여 산업 환경에서의 이상 탐지와 이해를 통합함으로써, 지도 미세 조정(supervised fine-tuning)과 강화 학습(reinforcement learning)의 하이브리드 학습 전략을 통해 MMAD 벤치마크에서 최첨단 성능을 달성하는 새로운 멀티모달 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 풀기 위해 노력하는 탐정이라고 상상해 보세요. 하지만 당신이 마주한 것은 범죄 현장이 아니라 공장 바닥입니다. 당신의 임무는 반짝이는 금속 부품 위의 긁힘, 캐슈넛 위의 이상한 얼룩, 혹은 회로 기판에서 사라진 나사처럼 아주 작고 이상한, 그곳에 있어서는 안 될 무언가를 찾아내는 것입니다. 컴퓨터의 세계에서 이것을 "이상 탐지(anomaly detection)"라고 부릅니다. 오랫동안 이를 수행하는 가장 똑똑한 방법은 두 명의 서로 다른 전문가를 고용하는 것이었습니다. 한 명은 이상한 지점을 강조하는 돋보기 역할을 하고, 다른 한 명은 단서를 읽고 무엇이 잘못되었는지 설명하는 탐정 역할을 하는 것이죠. 하지만 여기 함정이 있습니다. 때때로 돋거리가 엉뚱한 방향을 가리키거나, 그 지점에 너무 집착한 나머지 나머지 전체 그림을 보는 것을 잊어버리기도 합니다. 이 논문은 별도의 돋개가 필요 없는 새로운 종류의 탐정을 소개합니다. 대신, 이 탐정은 이상한 지점을 발견함과 동시에 그것이 무엇을 의미하는지 한 번에, 하나의 매끄러운 사고 과정으로 파악하는 법을 배웁니다. 이것이 중요한 이유는 공장에서 결함이 '어디에' 있는지 아는 것만큼이나, 그것이 '왜' 문제인지 아는 것도 매우 중요하기 때문입니다.
이 논문은 "멀티모달 거대 언어 모델"(이미지를 보고 텍스트를 읽을 수 있는 화려한 AI)인 OmniAD라는 새로운 시스템을 제시합니다. 이는 탐지와 설명을 동시에 수행하도록 설계되었습니다. 연구진은 결함이 있는 위치를 알려주는 별도의 탐지기로부터 '힌트'를 받는 기존의 방식—그들은 이를 "전문가 보조(Expert-Aid)" 패러다임이라 부릅니다—이 사실은 다소 결함이 있다는 것을 발견했습니다. 이는 마치 탐정에게 사건을 해결하라고 시키면서, 옆에서 누군가가 "여기 봐! 저기 봐!"라고 계속 소리치는 것과 같습니다. 문제는 그 소리치는 사람이 틀릴 수도 있고, 혹은 그 목소리가 너무 커서 탐정이 스스로 생각하는 것을 멈추고 그저 손가락이 가리키는 곳만 따라가게 만들 수도 있다는 점입니다. 이는 결함이 미세하거나 배경이 복잡할 때 실수를 유발합니다.
이를 해결하기 위해 OmniAD는 **의미론적 이상 인코딩(Semantic Anomaly Encoding)**이라는 영리한 기술을 사용합니다. 외부 도구에 의존하여 결함 주위에 상자를 그리는 대신, AI는 자신의 내부 "언어"를 사용하여 이상한 지점을 묘사하는 법을 배웁니다. 예를 들어, AI가 캐슈넛 사진을 보며 "좋아, 이 견과류의 오른쪽 상단 부분은 나머지 부분의 매끄럽고 크리미한 색상과 일치하지 않는 거칠고 갈색인 질감을 가지고 있어"라고 생각하는 것과 같습니다. 이 시각적인 이상함을 자신의 뇌 내부에서 텍식 설명으로 변환하는 것입니다. 이 텍스트는 이후 나머지 추론을 위한 가이드 역할을 합니다. AI는 단순히 "결함이 있다"라고 말하는 것이 아니라, "여기에 거친 질감이 보이는데, 이것이 매끄러운 선을 깨뜨리고 있으므로 이 견과류는 아마도 부서진 상태일 것이다"라고 말합니다. 이 과정을 **시각 가이드 텍ual 추론(Visual Guided Textual Reasoning)**이라고 합니다. 이는 마치 AI가 방금 찾은 시각적 단서를 사용하여 더 나은 설명을 작성하도록 스스로에게 말을 거는 것과 같습니다.
저자들은 MMAD를 포함한 다양한 산업 데이터셋에서 이 아이디어를 테스트했습니다. 그 결과, OmniAD는 GPT-4o와 같은 매우 유명한 모델들을 포함한 다른 AI 모델들보다 결함을 찾고 설명하는 데 훨씬 더 뛰어난 성능을 보였습니다. 실제로 MMAD 테스트에서 OmniAD는 평균 **79.9%**의 정확도를 기록하며, 이전의 최고 오픈 소스 모델을 상당한 차이로 앞질렀습니다. 논문은 "탐지"와 "설명"을 동일한 뇌 안에 유지함으로써 AI가 더 신뢰할 수 있게 된다고 제안합니다. 즉, 노이즈가 섞인 힌트에 혼란을 느끼지 않고, 전체 그림을 보는 것을 잊어버리지도 않습니다.
연구진은 또한 AI를 두 단계로 훈련시키는 것이 핵심임을 발견했습니다. 먼저, 결함에 대해 말하는 기초를 가르쳤습니다(지도 미세 조정, Supervised Fine-Tuning). 그다음, 문제를 해결하도록 연습시키되 정답과 올바른 설명이 모두 나왔을 때만 보상을 주었습니다(그룹 상대 정책 최적화, GRPO라는 방법 사용). 이 조합은 AI가 정밀하면서도 논리적이 되도록 도왔습니다. 이 논문은 AI가 스스로 증거를 생성하고 이를 즉시 사용하는 이 "내재적(intrinsic)" 접근 방식이, 서로 다른 도구 간에 단서를 주고받는 기존 방식보다 산업 문제를 처리하는 데 훨씬 더 강력한 방법임을 보여줍니다. 이 논문이 세상의 모든 문제를 해결한다고 주장하는 것은 아니지만, 결과는 이러한 통합된 사고 방식이 공장에서 AI를 더 똑똑하고 유용하게 만드는 데 있어 중요한 진전임을 강력하게 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.