← 최신 논문
💬 NLP

Which Source Wins? Task-Dependent Reliance in Vision-Language Models

이 논문은 시각-언어 모델(Vision-Language Models)이 작업 유형과 증거 구조에 따라 텍스트와 이미지 사이의 의존도를 동적으로 변화시키며, 산술 문제에서는 저하된 이미지보다 텍스트를 선호하지만 차트 기반 추론 작업에서는 저하된 텍스트보다 이미지를 더 강하게 선호한다는 사실을 밝혀낸다.

원저자: Rodela Ghosh, Aviral Gupta, Guangjing Wang

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rodela Ghosh, Aviral Gupta, Guangjing Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간은 혼란스러운 세상을 이해하는 데 매우 뛰어난 능력을 갖추고 있습니다. 우리가 시각이나 청각과 같은 서로 다른 감각으로부터 정보를 받을 때, 우리의 뇌는 자동으로 그 정보들의 비중을 조절합니다. 만약 한 소스가 노이즈가 심해지거나 이해하기 어려워지면, 우리는 본능적으로 더 명확한 쪽으로 주의를 돌립니다. 이러한 신뢰도를 재조정하는 능력은 우리가 현실을 헤쳐 나가는 방식의 근본적인 부분입니다. 시각-언어 모델(vision-language models)이라고 알려진 현대 인공지능 시스템들도 이와 유사한 작업을 수행하도록 설계되었습니다. 이 프로그램들은 이미지와 텍스트를 함께 처리하며, 자신이 보는 것과 읽는 것을 결합하여 문제를 해결하거나 질문에 답하려고 시도합니다. 오랫동안 연구자들은 이 시스템들이 고정된 선호도를 가지고 있다고 가정했습니다. 예를 들어, 이미지를 텍스트보다 더 신뢰하거나 혹은 그 반대라는 식의 가정이었습니다. 하지만 두 소스가 충돌하고 한쪽이 읽기 어려워졌을 때, 이 모델들이 동적으로 신뢰도를 조 조정할 수 있는지 여부는 여전히 불분명했습니다.

한 연구팀이 이러한 유연성을 테스트하기 위해 실험에 착수했습니다. 그들은 모델이 텍스트가 흐릿해지거나 이미지가 뭉개질 때 마음을 바꿀 것인지, 그리고 어느 쪽 소스가 손상되더라도 동일한 방식으로 반응할 것인지를 알고 싶었습니다. 답을 찾기 위해 그들은 일련의 통제된 퍼즐을 만들었습니다. 그들은 수학 문제를 이미지로 렌더링한 다음, 각 이미지에 완전히 다른 수학 문제의 텍스트를 짝지었습니다. 이는 모델이 두 가지 상충하는 답변 중 하나를 선택하도록 강요했습니다. 하나는 그림에서 도출된 것이고, 다른 하나는 글자에서 도출된 것입니다. 그들은 이 과정을 차트와 보고서에도 반복하여, 그래프는 하나의 답을 보여주고 함께 제공된 텍스트는 다른 답을 제시하는 새로운 데이터셋을 만들었습니다. 모든 경우에 대해, 그들은 블러(blur), 노이즈 또는 누락된 글자를 추가하여 한쪽 소스를 체계적으로 저하시켰으며, 다른 쪽 소스는 완벽하게 깨끗한 상태로 유지했습니다. 그런 다음 혼란이 커짐에 따라 모델이 어떤 소스를 따르는지 관찰했습니다.

결과는 놀라운 반전을 보여주었습니다. 연구자들이 수학 문제(화면 위에 인쇄된 텍스트와 글로 쓰인 텍스트 사이의 충돌인 경우)에 대해 모델을 테스트했을 때, 모델들은 특정한 방식으로 행동했습니다. 텍스트가 읽기 어려워짐에 따라, 모델들은 이미지가 저하되었을 때보다 텍스트로부터의 의존도를 더 강하게 낮추었습니다. 그러나 동일한 모델들을 차트와 보고서에 대해 테스트했을 때는 행동이 완전히 뒤바뀌었습니다. 이 시나리오에서는 차트가 읽기 어려워짐에 따라, 모델들은 텍스트가 저하되었을 때보다 시각적 소스로부터의 의존도를 더 강력하게 줄였습니다. 이러한 역전 현상은 6개의 서로 다른 오픈 소스 모델에서 일관되게 나타났으며, 가장 진보된 상용 모델 2개에서도 관찰되었습니다. 연구자들은 모델들이 시각 정보나 텍text 정보 중 어느 한쪽으로 영구적인 편향을 가지고 있는 것이 아님을 발견했습니다. 대신, 특정 소스에 대한 의존도는 전적으로 작업의 유형과 제시된 증거의 구조에 달려 있었습니다.

이 발견은 인공지능 시스템이 정보를 처리하는 방식에 있어 단일하고 변하지 않는 방식을 가지고 있다는 생각을 뒤흔듭니다. 연구는 모델들이 문제의 맥락에 민다는 것을 보여주었습니다. 시각 정보가 단순한 텍스트 렌더링이었을 때, 모델들은 텍스트 소스에 더 많이 의존했으며, 텍스트가 상당히 읽기 어려워졌을 때만 그 의존도를 낮추었습니다. 하지만 시각 정보가 복잡한 차트였을 때, 모델들은 텍스트 소스보다 시각적 소스로부터 더 공격적으로 의존도를 옮겼습니다. 연구자들은 차트를 일반적인 숫자 표로 교체하더라도 이 패턴이 유지됨을 확인했으며, 이는 효과가 단순히 차트의 그래픽 스타일 때문이 아니라 모델이 시각적 증거와 텍스트 증거 사이의 관계를 어떻게 인식하느냐에 관한 것임을 입증했습니다.

또한 연구는 모델들이 단순히 손실된 정보의 양에 반응하는 것인지도 다루었습니다. 연구자들은 저하된 소스만을 제공받았을 때 모델의 정확도가 얼마나 떨어지는지 측정했고, 이 손실을 고려하여 분석을 조정했습니다. 이러한 세심한 보정 후에도 행동의 역전 현상은 그대로 유지되었습니다. 이는 모델들이 단순히 손상의 심각도에 반응하는 것이 아니라, 주어진 상황에서 어떤 소스가 더 옳을 가능성이 높은지에 대해 더 복적인 판단을 내리고 있음을 시사합니다. 연구 결과는 이러한 모델들이 상충하는 소스 사이에서 중재하는 방식이 작업, 증거의 성격, 그리고 특정 모델 구조에 의해 형성되는 설정 의존적(setting-dependent) 행동임을 나타냅니다.

연구자들은 이러한 시스템이 주의를 어떻게 전환하는지 측정하는 새로운 방법을 제공함으로써, 인공지능이 상충하는 정보를 어떻게 다루는지에 대한 더 명확한 그림을 제시했습니다. 이 연구는 이러한 모델들이 고정된 선호도를 가진 것이 아니라 동적인 재할당이 가능하다는 것을 보여줍니다. 그러나 이러한 유연성은 균일하지 않으며, 맥락에 따라 변화합니다. 연구는 이러한 모델이 무엇을 신뢰할지 결정하는 과정을 이해하려면 보편적인 규칙을 가정하기보다 작업의 구체적인 세부 사항과 증거를 살펴봐야 한다고 결론짓습니다. 이러한 통찰은 정보가 불완전하거나 모순될 수 있는 실제 환경에 이러한 시스템을 배포하고자 하는 모든 이들에게 매우 중요하며, 모델의 신뢰도가 고정된 설정이 아닌 유동적인 변수임을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →