← 최신 논문
🤖 AI

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

이 논문은 표준 시각-언어 모델의 잠재 공간에서 교차 모달 부정 탐지의 비분리성을 밝히고, 언어적 문맥과 자기 지도 학습 기반의 비디오 표현을 활용하여 상당한 성능 향상을 달성하는 새로운 교차 모달 어텐션 아키텍처를 제안함으로써 교차 모달 부정 탐지의 과제를 다룬다.

원저자: Ali AbuSaleh, Leon Hammerla, Alexander Mehler

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Ali AbuSaleh, Leon Hammerla, Alexander Mehler

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

그림과 단어의 세계 속 '아니오(Not)'의 미스터리

당신이 로봇에게 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 햇살이 내리쬐는 해변 사진을 보여주며 "이것은 햇살이 내리쬐는 해변이다"라고 말합니다. 쉽죠? 로봇은 픽셀을 보고 이를 자신의 데이터베이스와 대조한 뒤, "알겠습니다"라고 답합니다. 하지만 당신이 "이것은 햇살이 내리쬐는 해변이 아니다"라고 말하면 어떻게 될까요? 갑자기 로봇은 혼란에 빠집니다. 로봇은 태양과 모래, 바다를 보고 있지만, 당신의 말은 그 모든 것을 무시하라고 명령하고 있기 때문입니다. 이것이 바로 **부정(negation)**이라는 까다로운 문제입니다. 어떤 것이 존재하지 않거나, 거짓이거나, 혹은 보이는 것과 반대임을 말하는 행위 말이죠.

인공지능의 세계에는 **시각-언어 모델(Vision-Language Models, VLMs)**이라 불리는 특별한 시스템들이 있습니다. 이들을 인터넷의 모든 책을 읽고 모든 사진을 본 아주 똑똑한 학생이라고 생각해보세요. 이들은 눈에 보이는 것을 설명하는 데는 뛰어나지만, '무(nothing)'라는 개념 앞에서는 고전합니다. 만약 한 정치인이 세금 인하를 보여주는 차트 앞에 서서 "나는 세금을 인하하지 않을 것이다"라고 말한다면, 인간은 즉각적으로 그 모순을 이해합니다. 하지만 로봇은 그저 차트와 정치인을 볼 뿐, 그 속에 담긴 '아 아니오(not)'를 완전히 놓칠 수도 있습니다. 기계가 다양한 형태의 미디어(예를 들어 단어와 영상을 섞는 것)를 가로질러 이러한 '아니오'를 포착하도록 학습시키는 방법은 오늘날 과학자들에게 거대한 난제입니다. 만약 우리가 기계에게 무엇이 결여되었는지 혹은 무엇이 부정되었는지를 이해하도록 가르치지 못한다면, 기계는 정치와 같은 중요한 영역에서의 인간 대화 중 가장 핵심적인 부분을 영원히 오해하게 될 것입니다.

탐정 이야기: 보이지 않는 '아니오'를 추적하다

이 논문에서 프랑크푸르트 괴테 대학교의 연구진은 이 미스터리를 풀기 위해 탐정 놀이를 하기로 했습니다. 그들은 다음과 같은 질문을 던졌습니다. "현재의 AI 시스템은 실제로 그들의 뇌 안에서 '부정'을 '볼' 수 있는가, 아니면 그것은 데이터 속에 존재하지 않는 유령인가?"

이를 알아내기 위해, 그들은 3,222개의 정치 영상 클립과 그에 수반되는 텍text를 수집했습니다. 그들은 매우 똑똑한 AI(Qwen2.5-VL이라 불림)를 디지털 주석가로 사용하여 사람들이 "아니오", "부인", 또는 "반대"를 말하는 지점을 라벨링했습니다. 그런 다음, AI의 내부 '뇌 지도'(잠재 표현, latent representations)가 '부정'을 '긍정'으로부터 분리해낼 수 있는지 확인하기 위해 일련의 테스트를 수행했습니다.

거대한 놀라움: 기계 속의 유령
연구진은 AI가 '고양이'나 '자동차'를 위한 명확한 영역을 가진 것처럼, '부정'을 위한 명확하고 구별된 영역을 뇌 속에 가지고 있을 것이라고 예상했습니다. 하지만 그들의 예상은 틀렸습니다. 데이터를 살펴보았을 때, 부정은 AI의 마음속에서 명확한 형태나 군집(cluster)을 형성하지 않았습니다. 이는 마치 실제로는 별개의 띠로 존재하지 않는 무지개 속에서 특정 색깔을 찾으려는 것과 같습니다. 그 색은 그저 다른 모든 것과 섞여 있을 뿐입니다.

그들은 '부정' 영상과 '비부정' 영상을 분류하기 위해 표준 수학 도구들을 사용해 보았습니다. 결과는 실망스러웠습니다. AI의 성능은 무작위 추측(동전 던지기 같은)보다 나을 것이 없었습니다. 심지어 동작을 이해하도록 설계된 새로운 고급 비디오 모델(JEPA라고 불림)을 사용했을 때도, '부정'의 신호는 여전히 보이지 않았습니다. 연구진은 현재의 AI 시스템이 '아니오'라는 개념을 독립적인 특징으로서 자연스럽게 인코딩하지 못한다고 결론지었습니다. '아니오'는 AI가 보는 '대상'이 아니라, 그림과 단어를 함께 볼 때만 존재하는 '관계'인 것입니다.

해결책: 마법의 다리
AI가 스스로 '아니오'를 찾을 수 없다면, 어떻게 해결해야 할까요? 연구팀은 **교차 모달 어텐션 아키텍처(Cross-Modal Attention Architecture)**라고 불리는 새로운 종류의 '다리'를 구축했습니다. 두 친구가 수수께끼를 풀고 있다고 상상해 보세요. 한 친구는 그림만 가지고 있고, 다른 친구는 단어만 가지고 있습니다. 각자 혼자 일한다면 그들은 실패할 것입니다. 하지만 그들이 테이블에 앉아 서로의 단서를 가리키며 "이 단어를 보는 동안 저 이미지의 저 부분을 봐!"라고 끊임없이 말한다면, 그들은 문제를 풀 수 있습니다.

이 새로운 시스템은 AI가 텍스트와 영상을 동시에 끊임없이 비교하도록 강제합니다. 영상을 보고 텍스트를 따로 보는 대신, AI는 "이 단어가 이 이미지의 의미를 바꾸는가?"라고 묻는 법을 배웁니다. 이 다리를 구축함으로써 연구진은 엄청난 개선을 목격했습니다. 그들의 새로운 모델은 텍스트나 영상 중 하나만을 본 모델들보다 표준 테스트(F1 점수)에서 7.03% 더 높은 점수를 기록했습니다. 이는 '아니오'를 이해하려면 감각을 섞어야 한다는 것을 증명했습니다.

비대칭성: 누가 누구를 필요로 하는가?
가장 흥кси로운 발견 중 하나는 부정이 작동하는 방식에서의 기묘한 불균형이었습니다. 연구진은 텍ual 부정(단어로 "아니오"라고 말하는 것)이 종종 독자적으로 존재한다는 것을 발견했습니다. 만약 누군가 "나는 행복하지 않다"라고 쓴다면, 설령 이미지가 관련이 없더라도 그 단어들이 전체 의미를 전달합니다.

하지만 시각적 부정(영상으로 "아니오"를 보여주는 것)은 전적으로 의존적입니다. 빈 방을 보여주는 영상이 자동으로 "파티가 없음"을 의미하지는 않습니다. 그것은 텍스트나 맥락이 당신에게 파티를 찾아보라고 말할 때만 "파티가 없음"을 의미합니다. 연구진은 시각적 부정이 의미론적으로 텍스트에 의존적이라는 것을 발견했습니다. 데이터에 따르면, 텍스트와 영상이 서로 관련이 없거나 텍스트의 지원 없이 영상이 단독으로 존재할 때 시각적 부정은 완전히 나타나지 않았습니다. 단어가 안내 역할을 하지 않으면, 영상은 그저 빈 방의 사진일 뿐입니다. AI는 시각적인 "아니오"를 이해하기 위해서 반드시 텍스트를 먼저 들어야 한다는 것을 배웠습니다.

인간 vs 기계 테스트
연구진은 자신들의 작업을 재검증하기 위해, 매우 똑똑한 AI(동일한 Qwen 모델)에게 심판 역할을 맡겨 영상을 라벨링하게 했습니다. 그런 다음 AI의 라벨을 인간 전문가의 라벨과 비교했습니다.

  • AI가 텍스트만 보았을 때, 인간과 약 53% 일치하며 부정의 여부를 꽤 잘 잡아냈습니다.
  • 그러나 AI가 텍스트와 영상을 모두 보았을 때, 오히려 성능이 떨어져 인간과 20% 미만으로 일치했습니다.

이는 결정적인 단서였습니다. 이는 영상을 추가하는 것이 AI의 이해를 돕기는커녕, 오히려 시각적 노이즈가 AI를 혼란스럽게 만들었음을 시사합니다. 이는 현재의 AI 모델들이 이러한 감각들을 스스로 융합할 준비가 되어 있지 않음을 확인시켜 주었습니다. 그들은 이 혼합된 정보를 이해하기 위해 (연구진이 만든 것과 같은) 특별한 아키텍처가 필요합니다.

이것이 미래에 갖는 의미

이 논문은 부정의 문제를 영원히 해결했다고 주장하는 것이 아닙니다. 대신 매우 명확한 진단을 내립니다: 컴퓨터에게 더 많은 사진이나 더 많은 단어를 보여준다고 해서 '아니오'를 이해하도록 가르칠 수는 없습니다. 부정의 개념은 표준적인 AI의 뇌가 스스로 포착하기에는 너무나 미끄러운 것입니다.

핵심적인 교훈은 부정은 교차 모달(cross-modal) 현상이라는 점입니다. 그것은 텍스트나 이미지 내부가 아니라, 텍스트와 이미지 사이의 공간에 존재합니다. 인간의 의사소통을 진정으로 이해하는 AI—특히 사람들이 말하는 것과 보여주는 것이 다른 정치와 같은 복잡한 분야의 AI—를 구축하려면, 서로 다른 유형의 정보를 끊임없이 비교하고 대조하도록 설계된 시스템이 필요합니다. 연구진은 이 '어텐션의 다리'를 구축함으로써, 마침내 기계에게 침묵을 듣고 부재를 보는 법을 가르치기 시작할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →