← 최신 논문
💻 computer science

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

본 논문은 중간 확산 표현(intermediate diffusion representations)을 CLIP 기반 파이프라인에 통합하여 추론 비용을 증가시키지 않으면서도 보조적인 지도 학습과 더 풍부한 구성 인식 의미론을 제공함으로써 구성적 제로샷 학습(Compositional Zero-Shot Learning)을 향상시키는 프레임워크인 DIFFCZSL을 제안한다.

원저자: Hangyu Tian, Zhenqi He, Yanghao Wang, Long Chen

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hangyu Tian, Zhenqi He, Yanghao Wang, Long Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 빨간 사과와 초록 사과 사진을 보고 '빨강'과 '초록'이 무엇을 의미하는지 학습한 뒤, 한 번도 본 적 없는 '초록 사과'를 즉각적으로 인식할 수 있는 세상을 상상해 보십시오. 이것은 구성적 제로샷 학습(compositional zero-shot learning)이라는 도전 과제로, 단순한 개념들이 어떻게 결합하여 새롭고 복잡한 아이디어를 형성하는지를 기계에게 가르치는 인공지능의 특정 분야입니다. 수십 년 동안 연구자들은 컴퓨터에게 수천 개의 사례를 보여주며 이 기술을 가르치려 노력해 왔지만, 기계는 자신이 연습하지 않은 방식으로 이러한 아이디어들을 혼합하고 조합하라는 요청을 받으면 종종 어려움을 겪습니다. 기계는 '바나나' 같은 물체나 '익은' 같은 상태는 인식할 수 있지만, '익은 바나나'가 단순히 '익은' 것 혹은 일반적인 '바나나'와는 다른 특정한 시각적 실체라는 점을 이해하는 데는 실패하곤 합니다. 핵심적인 어려움은 기계에게 부분 그 자체뿐만 아니라 부분들 사이의 관계를 보는 법을 가르치는 데 있습니다.

홍콩 과학기술대학교의 연구팀은 더 많은 사례를 가르치는 것이 아니라, 다른 종류의 지능을 빌려옴으로써 기계가 이 기술을 배울 수 있도록 돕는 새로운 방법을 찾아냈습니다. 그들은 표준 AI 모델이 이미지를 서로 구별하는 데는 뛰어나지만, 개념들이 어떻게 섞이는지를 이해하는 데는 때때로 서투르다는 사실을 발견했습니다. 이를 해결하기 위해 연구진은 훈련 과정에 '생성적(generative)' 조력자를 도입했습니다. 이 조력자를 단순히 이미지를 식별하는 것이 아니라 텍스트 설명을 통해 이미지를 만들어내도록 설계된 원래의 모델이라고 생각하십시오. 이 이미지 생성 모델의 내부 작동 방식을 AI가 학습하는 동안 들여다보게 함으로써, 연구진은 속성과 물체가 어떻게 서로 어우러지는지에 대한 더 깊은 이해를 향해 학습 과정을 안내할 수 있었습니다.

티안 항위(Hang-yu Tian)와 동료들이 이끄는 연구진은 DIFFCZSL이라 불리는 시스템을 구축했습니다. 이들의 접근 방식은 먼저 사진과 단어를 매칭하는 데 매우 능숙한 CLIP이라는 강력한 기존 AI 모델에서 시작됩니다. 그러나 연구진은 CLIP이 때때로 '익은 바나나'를 익음이라는 상태가 과일의 외형을 변화시키는 하나의 통합된 개념으로 보기보다는, 그저 '익은'이라는 단어 근처에 있는 바나나로 취급한다는 점을 포착했습니다. 이를 교정하기 위해 연구진은 훈련 단계 중에 두 번째 단계를 추가했습니다. 텍text 설명을 바탕으로 그림을 그릴 수 있는 종류의 사전 학습된 이미지 생성 모델을 가져와서, 메인 AI가 공부하고 있는 것과 동일한 이미지들을 살펴보게 했습니다. 이 생성 모델은 세상을 보는 독특한 방식을 가지고 있습니다. 텍스트를 바탕으로 이미지를 처음부터 재구성해야 하기 때문에, 이 모델은 바나나 껍질의 질감이나 사과의 색상과 같은 구체적인 세부 사항이 물체 자체와 어떻게 상호작작용하는지에 각별히 주의를 기울입니다.

연구진은 메인 AI를 이 생성 모델로 대체한 것이 아닙니다. 대신, 생성 모델을 교사로 사용했습니다. 메인 AI가 학습하는 동안, 생성 모델은 이미지의 구조에 대한 추가적인 힌트를 제공했습니다. 그것은 마치 메인 AI에게 "봐, 바나나를 볼 때 '익은'이라는 개념은 단순히 별개의 라벨이 아니야. 그것은 바나나의 시각적 형태와 색상을 변화시켜"라고 속삭이는 것과 같았습니다. 연구진은 이 생성 모델로부터 이러한 내부 힌트를 추출하여 메인 AI의 이해와 정렬시켰습니다. 이 과정은 컴퓨터가 학습하는 동안에만 일어났습니다. 훈련이 끝나면 생성 모델은 제거되었고, 메인 AI는 원래의 속도와 구조를 유지하면서도 훨씬 더 날카로운 새로운 조합 인식 능력을 갖게 되었습니다.

이 실험의 결과는 신발부터 과일, 일상적인 물건에 이르기까지 세 가지 서로 다른 이미지 세트를 통해 측정되었습니다. 모든 경우에서, 이 추가적인 안내를 받은 AI 모델들은 그렇지 않은 모델들보다 더 나은 성능을 보였습니다. UT-Zappos라는 신발 데이터셋에서 연구진은 상당한 정확도 상승을 목격했는데, 이는 모델들이 보지 못한 조합을 훨씬 더 자주 정확하게 식별했음을 의미합니다. 예를 들어, 새로운 맥락에서 '슬라이스 된 사과'나 '익은 바나나'를 식별하도록 요청받았을 때, 가이드를 받은 모델들은 혼동할 가능성이 훨씬 낮았습니다. 이러한 개선은 알려진 범주로 제한되었을 때나 광범위한 가능한 조합으로 열려 있을 때나 일관되게 나타났습니다. 연구진은 모델들이 이전에 보았던 것에 대한 지식과 한 번도 본 적 없는 것을 추측하는 능력 사이에서 더 잘 균형을 잡게 된다는 것을 발견했는데, 이는 새로운 상황이 끊임없이 발생하는 현실 세계의 응용 분야에서 매우 중요한 기술입니다.

가장 놀라운 발견 중 하나는 이러한 개선이 컴퓨터를 느리게 만들거나 무겁게 만들지 않고 이루어졌다는 점입니다. 생성 모델은 학습 단계에서만 가이드로 사용되고 그 이후에는 폐기되었기 때문에, 최종 시스템은 원래 모델만큼 빠르게 실행되었습니다. 연구진은 특정 생성 모델의 종류가 중요한지도 테스트했는데, 더 최신의 발전된 버전이 더 나은 가이드를 제공한다는 것을 발견했습니다. 그들은 또한 자신들의 방법을 다른 유형의 강력한 AI 모델들과 비교했으며, 생성 모델의 고유한 개념 혼합 이해 능력이 핵심이지, 단순히 그것이 거대한 사전 학습된 시스템이라는 사실이 핵심이 아님을 찾아냈습니다. 이 연구는 텍스트로부터 이미지를 생성하는 방식의 생성 모델들이 아이디어를 결합하는 법을 가르치는 데 완벽한 세상의 숨겨진 구조를 포착하고 있음을 시사합니다.

이 작업은 인공지능의 유망한 경로를 강조합니다. 모든 것을 완벽하게 수행하는 단일한 거대 모델을 만드는 대신, 연구진은 서로 다른 유형의 모델들의 강점을 결합함으로써 더 나은 결과를 얻을 수 있음을 보여주었습니다. 이미지를 만드는 모델이 이미지를 인식하는 모델을 가르치게 함으로써, 그들은 컴퓨터가 세상을 이해하는 방식의 간극을 메웠습니다. 이 연구 결과는 생성 모델과 판별 모델이 협력하여, 단순히 정확할 뿐만 아니라 복합적인 현실의 구성적 본질을 깊이 있게 이해하는 시스템을 만들어내는 AI의 미래가 바로 여기에 있음을 시사합니다. 이 접근 방식은 기계가 사물들이 어떻게 서로 맞물리는지에 대해 더 똑똑해지도록 만드는 단순하고 효과적인 방법을 제공하며, 일상적인 작업에 추가적인 부담을 주지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →