← 최신 논문
💻 computer science

Conservative Proxy Prompting for Reliable Frozen Vision–Language Models with Missing Modalities

이 논문은 결측된 모달리티 상황에서 고정된 시각-언어 모델의 신뢰성을 향상시키기 위해, 특징 공간 프록시 표현을 구축하고 오도하는 신호를 피하기 위해 그 기여도를 보수적으로 조절하는 매개변수 효율적인 프레임워크인 Conservative Proxy Prompting (CPP)를 제안한다.

원저자: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 시각-언어 모델(vision-language models)이라 불리는 새로운 계층의 시스템이 등장하고 있습니다. 이들은 사진을 보고 텍스트를 동시에 읽음으로써 세상을 이해하도록 훈련된 디지털 지성체로, 이미지와 단어가 서로 어떻게 연관되는지를 학습합니다. 이들은 방대한 양의 쌍을 이룬 이미지와 텍스트 컬렉션을 통해 학습했기에, 사진을 묘사하거나 장면 속 질문에 답하는 등의 작업에서 놀라운 숙련도를 보여줍니다. 하지만 이러한 시스템은 이미지와 설명이 항상 동시에 제공될 것이라는 취약한 가정 위에 구축되어 있습니다. 현실 세계의 무질서한 상황에서는 그러한 보장이 거의 이루어지지 않습니다. 센서가 고장 나거나, 전송 과정에서 데이터가 손실되거나, 개인정보 필터가 설명을 삭제하여 시스템에 예상했던 정보의 절반만을 남겨두는 일이 발생할 수 있습니다. 완전한 쌍으로 훈련된 모델이 갑자기 퍼즐의 한 조각만 가지고 추측해야 하는 상황에 직면하면, 그 확신은 흔히 무너지고 답변은 신뢰할 수 없게 됩니다. 연구자들의 과제는 단순히 모델이 누락된 정보를 추측하도록 돕는 것이 아니라, 모델이 실제로 '보고 있는 것'과 단순히 '추론하고 있는 것'의 차이를 알 수 있도록 가르치는 것입니다.

절강사범대학교와 순와타이 대학의 연구진은 이 문제를 해결하기 위해 '보수적 대리 프롬프팅(Conservative Proxy Prompting)'이라 불리는 새로운 방법을 개발했습니다. 이들의 접근 방식은 인공지능에 대한 근본적인 진실을 인정합니다. 즉, 모델이 눈에 보이는 것을 바탕으로 누락된 정보를 추측해야 할 때, 그 추측은 본질적으로 불확실하다는 점입니다. 식당에서 음식을 식별하려는 사람을 상상해 보십시오. 음식도 보이고 메뉴판도 읽을 수 있다면 확신할 수 있습니다. 만약 메뉴판이 없다면 음식을 보고 이름을 추측할 수는 있겠지만, 자신의 답변에 대해 약간의 불확실함을 유지해야 합니다. 기존의 방법들은 누락된 정보를 마치 실제인 것처럼 재구성하려고 시하며, 이는 추측을 직접적인 관찰과 동일한 비중으로 취급하는 것과 같습니다. 연구진은 재구성된 데이터는 단지 추정치일 뿐이며, 이를 사실로 취급하는 것은 시스템을 오도할 수 있기 때문에 위험하다고 주장합니다. 대신, 이들의 새로운 프레임워크는 이러한 추측을 '대리(proxy)' 증거, 즉 유용하지만 신중한 다룸이 필요한 것으로 취급합니다.

그들의 해결책의 핵심은 기존의 강력한 AI 모델을 처음부터 다시 훈련시킬 필요 없이 작동하는 2단계 전략을 포함합니다. 첫째, 시스템은 '프롬프트 학습(prompt learning)' 기술을 사용하여 아주 적은 수의 조정 가능한 설정값만을 이용해 모델의 이해도를 특정 작업(예: 영화 장르나 음식 유형 식별)에 맞게 부드럽게 유도합니다. 이를 통해 모델은 전체 뇌를 개조하지 않고도 특정 업무에 대해 예리하고 준비된 상태를 유지할 수 있습니다. 둘째, 가장 중요한 점은 시스템이 누락된 데이터를 처리하는 메커니즘을 도입한다는 것입니다. 사진이 누락되었을 때, 시스템은 텍스트를 사용하여 사진이 어떤 모습일지에 대한 대략적인 스케치를 만듭니다. 텍스트가 누락되었을 때는 사진을 사용하여 단어를 추측합니다. 하지만 여기서 결정적인 차이가 있습니다. 이 추측된 정보가 실제 데이터와 섞이기 전에, 시스템은 의도적으로 그 영향력을 축소합니다. 시스템은 '보수적인' 필터를 적용하여 추측의 가중치를 줄임으로써, 추측이 직접적인 증거를 압도하지 않으면서도 결정을 뒷받กัน할 수 있도록 합니다. 이는 만약 추측이 틀리더라도 최종 답변을 함께 끌어내리지 않도록 보장합니다.

이 아이디어를 테스트하기 위해 연구진은 세 가지 매우 다른 실제 데이터셋을 통해 이 방법을 시험했습니다. 그들은 영화 포스터와 줄거리 요약 모음, 방대한 양의 음식 이미지와 레시피, 그리고 혐오 표현을 감지하는 능력을 테스트하기 위한 도전적인 인터넷 밈(meme) 세트를 사용했습니다. 각 경우에서 연구진은 이미지나 텍스트 중 하나를 무작위로 제거함으로써 실제 세계의 실패 상황을 시뮬레이션했으며, 때로는 샘플의 최대 90%까지 정보를 제거했습니다. 결과는 명확했습니다. 새로운 방법은 누락된 데이터를 단순히 재구성하려고 시도했던 다른 접근 방식들을 일관되게 능가했습니다. 추측의 영향력을 억제함으로써, 시스템은 정보가 대부분 누락된 상황에서도 높은 정확도를 유지했습니다. 이는 모델이 완벽하게 추측할 필요는 없으며, 단지 자신의 추측을 얼마나 신뢰해야 하는지를 아는 것이 중요하다는 것을 입증했습니다.

또한 연구는 이러한 신뢰성이 무거운 비용 없이 가능하다는 것을 밝혀냈습니다. 이 새로운 방법은 이러한 결과를 얻기 위해 약 160만에서 270만 개 사이의 매우 적은 수의 조정 가능한 파라미터만을 필요로 했습니다. 이와 비교하여, 유사한 강건성을 달야하고자 했던 다른 방법들은 거의 3배 더 많은 조정 설정을 요구했습니다. 이러한 효율성은 시스템을 새로운 작업에 빠르게 적응시키고 쉽게 저장할 수 있으며, 거대한 컴퓨팅 파워를 필요로 하지 않는다는 점에서 매우 중요합니다. 연구진은 특정 '유도(nudge)' 설정의 수가 중요하지만, 모든 상황에 적용되는 단 하나의 마법 같은 숫자는 없으며, 적절한 양의 조정이 일반적으로 최적의 지점이라는 것을 발견했습니다. 또한, 시스템은 이전에 본 적 없는 상황도 처리할 수 있음을 보여주었습니다. 완전한 데이터로만 훈련된 후 누락된 데이터로 테스트되었을 때도 잘 적응했는데, 이는 추측에 대해 신중을 기하는 원칙이 특정 훈련 사례를 넘어 일반화될 수 있는 강력한 전략임을 시사합니다.

궁극적으로, 이 연구는 누락된 정보를 완벽하게 재현하는 것에서 벗어나, 그 재현의 불확실성을 관리하는 데 초점을 맞춥니다. 연구진은 데이터가 종종 불완전한 세상에서, 가장 신뢰할 수 있는 AI 시스템은 모든 빈틈을 채우려고 노력하는 시스템이 아니라, 자신의 지식의 한계를 이해하는 시스템임을 입증했습니다. 추론된 정보를 직접적인 관찰과 동등한 파트너가 아닌, 도움이 되지만 부차적인 목소리로 취급함으로써 시스템은 더 안정적이고 신뢰할 수 있게 됩니다. 이러한 접근 방식은 센서가 고장 나거나 데이터가 손실되는 실제 세계에서 지능형 시스템을 배포하기 위한 실질적인 경로를 제시하며, 전체 그림을 보고 있지 못할 때도 이러한 도구들이 유용하게 유지될 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →