SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
이 논문은 멀티모달 거대 언어 모델이 시각적 단서와 텍xtual 단서 사이의 충돌을 어떻게 해결하는지 평가하기 위해 25,555개의 이미지 변형으로 구성된 통제된 반사실적 벤치마크인 SIGNPOST-Bench를 소개하며, 적대적 텍스트 개입이 지리적 위치 추정 정확도를 유의미하게 저하시키고 평가된 20개 모델 전반에 걸쳐 뚜렷한 중재 행동을 드러낸다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 이 사진이 어디서 찍혔는지 밝혀내려는 탐정이라고 상상해 보십시오. 당신에게는 두 가지 단서가 있습니다. 첫 번째는 건축물, 나무, 자동차, 그리고 건물을 비추는 빛의 방식과 같은 시각적 장면입니다. 두 번째는 사진 속 표지판, 상점 간판, 또는 광고판에 적힌 텍text입니다. 보통 이 단서들은 서로 일치합니다. "파리"라고 적힌 표지판은 파리에 있을 법한 건물 위에 놓여 있습니다. 하지만 이 단서들이 서로 충돌한다면 어떻게 될까요? 만약 사진에는 눈 덮인 산속의 나무 오두막이 보이는데, 창문에 있는 밝은 네온사인에는 "사하라 사막에 오신 것을 환영합니다"라고 적혀 있다면 어떨까요?
이것이 바로 **멀티모달 거대 언어 모델(MLLM)**의 세계입니다. 이들은 이미지와 텍스트를 동시에 보고 읽을 수 있는 매우 똑똑한 AI 컴퓨터입니다. 과학자들은 이들이 세상을 추론하기 위해 이러한 단서들을 결합하도록 가르쳐 왔습니다. 하지만 큰 의문이 하나 있습니다. 시각적 단서와 텍스트 단서가 서로 싸울 때, AI는 무엇을 신뢰할까요? AI는 혼란스러운 표지판을 무시하고 눈(snow)을 바라볼까요? 아니면 표지판을 맹목적으로 믿고 눈(snow)을 잊어버릴까요? 지금까지는 이러한 특정한 종류의 혼란을 테스트할 좋은 방법이 없었습니다.
여기, 연구자들이 AI를 속이는 게임을 하기 위해 설계한 새로운 실험인 SIGNPOST-Bench가 등장했습니다. 그들은 수천 장의 실제 사진을 가져와 각 사진에 대해 특별한 "역사실적(counterfactual)" 버전들을 만들었습니다. 이는 하나의 원본 사진을 가지고 네 개의 새로운 복사본을 만드는 사진 편집 워크숍을 생각하면 쉽습니다:
- 공백(The Blank): 텍스트를 완전히 지워버렸습니다.
- 유사함(The Similar): 표지판을 해당 위치에서 여전히 말이 되는 다른 것으로 교체했습니다 (예: "미시간에 오신 것을 환영합니다"를 "디트로이트에 오신 것을 환영합니다"로 변경).
- 무작위(The Random): 장소와 전혀 상관없는 표지판을 붙였습니다 (예: "달에 오신 것을 환영합니다").
- 적대적(The Adversarial): 이것이 까다로운 부분입니다. 표지판을 특정하고 다른 장소를 가리키는 거짓말로 교체했습니다 (예: "미시간에 오신 것을 환영합니다"를 "뉴욕에 오신 것을 환영합니다"로 변경).
연구진은 7개 주요 기술 기업에서 나온 20개의 서로 다른 AI 모델에게 모든 다섯 가지 버전의 사진에 대해 위치를 추측하도록 요청했습니다. 그들은 AI가 거짓말을 알아챌 수 있는지, 아니면 새로운 표지판에 속아 넘어갈지를 보고 싶었습니다.
결과는 상당히 놀라웠습니다. AI가 원본 사진을 보았을 때는 위치를 꽤 잘 맞혔습니다. 하지만 적대적(Adversarial) 거짓말이 도입되었을 때, 모델들은 혼란에 빠졌습니다. 평균적으로 AI의 정확도는 4.8배 감소했습니다. 약 282km 정도의 오차를 보이던 AI는 이제 1,347km나 벗어나게 되었습니다.
더 흥anche한 점은, AI가 단순히 성능이 나빠진 것이 아니라 잘못된 방향으로 유도되었다는 것입니다. 표지판에 "뉴욕"이라고 적혀 있으면, AI는 단순히 무작위로 추측하는 것이 아니라 실제로 뉴욕 쪽으로 가까워졌습니다. 사실, 테스트한 모든 모델에서 충돌하는 텍스트의 존재는 정답을 거짓말이 가리키는 방향으로 끌어당겼습니다. 약 **6.5%에서 20.1%**의 확률로, AI의 추측은 거짓 표지판이 가리키는 곳으로부터 50km 미만의 거리에 위치했습니다.
또한 이 연구는 표지판을 읽는 능력이나 사진을 보는 능력이 "똑똑함"을 보장하지 않는다는 것을 발견했습니다. 깨끗하고 정직한 사진을 통해 위치를 아주 잘 맞히던 일부 모델들이, 오히려 더 작은 규모의 모델들보다 거짓말을 무시하는 데 더 서툴렀습니다. 표지판을 읽을 수 있다고 해서 사진의 나머지 부분과 모순될 때 그것을 무시할 줄 안다는 뜻은 아닙니다.
마지막으로, 연구진은 AI에게 구체적으로 충돌을 주의 깊게 살펴보라고 "코칭"을 시도했습니다. 이것은 AI가 무언가 잘못되었다는 것을 49%의 확률로 깨닫게 하는 데는 도움이 되었지만, 실제로 올바른 위치를 맞히는 데는 도움이 되지 않았습니다. AI는 자신이 혼란스럽다는 것은 알았지만, 여전히 그 퍼즐을 어떻게 풀어야 할지는 알지 못했습니다.
요약하자면, 이 논문은 현재의 AI 모델들이 텍스트와 이미지가 불일치할 때 여전히 매우 쉽게 속는다는 것을 보여줍니다. 그들은 눈에 뻔히 보이는 거짓말일지라도 텍스트를 너무 많이 신뢰하는 경향이 있습니다. 연구진은 미래의 AI 개발자들이 자신들의 모델이 정확히 어디에서 실패하는지 이해하고, 눈을 믿어야 할 때와 표지판을 의심해야 할 때를 아는 더 나은 탐정이 되도록 가르칠 수 있도록 돕기 위해 이 "SIGNPOST-Bench" 테스트를 구축했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.