← 최신 논문
💻 computer science

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

이 논문은 입력에 무관한 학습 가능한 잠재 앵커(latent anchors)를 안정적인 사전 지식으로 활용하여 인스턴스 수준 특징의 불안정성을 극복하고, 극단적인 모달리티 결손 시나리오에서도 최첨단 시각 인식 성능을 달성하는 "신뢰할 수 있는 잠재 프롬프트로부터의 학습(Learning from Reliable Latent Prompts)"이라는 새로운 패러다임을 제안한다.

원저자: Taixi Chen, Nancy Guo

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Taixi Chen, Nancy Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 사진과 목격자 진술이라는 두 가지 유형의 증거를 통해 범죄를 해결하도록 훈련된 천재 탐정(AI 모델)이 있다고 상상해 보십시오. 완벽한 세상이라면 탐정은 항상 사진과 진술을 모두 받게 될 것입니다. 하지만 현실 세계에서는 문제가 발생합니다. 때로는 카메라가 고장 나기도 하고(사진 없음), 때로는 목격자가 너무 겁에 질려 말을 하지 못하기도 합니다(진술 없음). 혹은 둘 다 사라지는 경우도 있습니다.

탐정이 완벽한 사건들로만 훈련받는다면, 증거가 누락되었을 때 혼란에 빠져 처참하게 실패하게 됩니다.

기존 방식: "남아 있는 것으로 추측하기"

이 문제를 해결하려는 이전의 시도들은 탐정에게 남아 있는 약간의 증거를 바탕으로 누락된 증거가 어떠했을지추측하도록 요청하는 것과 같았습니다.

  • 문제점: 만약 사진이 흐릿하거나 목격자의 진술이 절반쯤 지워졌다면, 탐정의 "추측"은 불안정한 토대 위에 세워지게 됩니다. 누락된 증거가 많아질수록 그 추측은 점점 더 형편없어집니다. 이는 마치 퍼즐 조각 하나가 아주 작고 흐릿하다는 이유만으로 그 조각이 전체 그림을 말해줄 것이라 믿으며 퍼즐을 완성하려는 것과 같습니다. 조각이 많이 부족할수록 그림을 틀릴 가능성도 높아집니다.

새로운 아이디어: "신뢰할 수 있는 기억 저장소"

Chen Taixi와 Guo Nancy라는 저자들은 **신뢰할 수 있는 잠재적 프롬프트로부터의 학습(Learning from Reliable Latent Prompts, LLP)**이라 불리는 다른 접근 방식을 제안합니다.

이 방식은 탐정에게 현재 가지고 있는 부서진 증거를 바탕으로 추측하게 하는 대신, 안정적인 내부 기억 저장소(이를 "잠재적 앵커(Latent Anchors)"라고 부릅니다)를 제공합니다.

작동 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다:

  1. 기억 저장소 (잠재적 앵커): 탐정에게 특별하고 흔들림 없는 수첩이 있다고 상상해 보십시오. 이 수첩에는 현재 범죄 현장에 대한 구체적인 세부 사항이 들어있지 않습니다. 대신, 사진이 보통 어떤 모습인지, 그리고 목격자 진술이 보통 어떤 식으로 들리는지에 대한 일반적인 본질이 담겨 있습니다. 이 수첩은 "입력 불가지론적(input-agnostic)"입니다. 즉, 현재의 증거가 누락되거나 손상되었는지 여부에 상관없이, "사진이란 무엇인가"와 "텍스트란 무엇인가"에 대한 신뢰할 수 있는 핵심 지식을 보유하고 있습니다.
  2. 대화 (이중 경로 교차 주의/Dual-Path Cross-Attention): 탐정이 증거가 누락된 사건에 직면했을 때, 그들은 부서진 증거를 억지로 이해하려고 애쓰지 않습니다. 대신, 자신의 신뢰할 수 있는 수첩을 펼칩니다. 그들은 수첩에 담긴 "사진 지식"이 수첩에 담긴 "텍스트 지식"과 대화하도록 합니다.
    • 예시: 만약 사진이 없다면, 수첩 속의 "텍스트 지식"이 해당 이야기 유형에 대해 사진이 보통 어떤 모습이었는지를 회상함으로써 빈틈을 채워줍니다.
    • 이들은 서로 아이디어를 교환하여, 증거가 일부 누락된 상황에서도 탐정이 사건을 해결할 수 있도록 돕는 새롭고 신뢰할 수 있는 가이드(즉, "프롬프트")를 만들어냅니다.
  3. 결과: 이 가이드는 부서진 증거가 아니라 안정적인 기억 저장소에서 나오기 때문에, 탐정은 증거의 90%가 사라지더라도 침착하고 정확하게 상태를 유지할 수 있습니다.

연구 결과

연구진은 이 아이디어를 세 가지 다른 "범죄 현장"(데이터셋)에서 테스트했습니다:

  • 영화 장르: 포스터와 줄거리를 보고 영화의 장르를 맞히는 것.
  • 음식: 사진과 설명을 통해 요리를 식별하는 것.
  • 혐오 밈(Hateful Memes): 이미지와 텍스트가 결합되었을 때 악의적인지 감지하는 것.

결과:

  • 모든 것이 누락되었을 때: 기존 방식("추측하는 자들")은 완전히 무너졌습니다.
  • 새로운 방식 (LLP): 데이터의 90%가 누락되었을 때도 높은 수준의 성능을 유지했습니다. 이는 테스트된 모든 방법 중 가장 뛰어난 성과였습니다.
  • 성공 이유: 논문은 탐정이 부서진 단서에 의존하는 대신, 안정적인 내부 기억을 참조하게 함으로써 시스템이 훨씬 더 강력하고 신뢰할 수 있게 된다는 것을 보여줍니다.

요약하자면

이 논문은 데이터가 누락되었을 때, 우리가 가진 부서진 조각들 위에 해결책을 구축하려 하지 말고, 부서진 데이터와 독립적으로 존재하는 안정적인 내부 지식 위에 해결책을 구축해야 한다고 주장합니다. 이를 통해 AI는 증거가 불완순하더라도 게임의 규칙을 알고 있는 탐정처럼, 빈칸을 신뢰할 수 있게 채울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →