LaViSA: A Language and Vision Structural Ambiguity Benchmark
이 논문은 시각-언어 모델(Vision-Language Models)의 구조적 모호성 해결 능력을 평가하기 위해 7개 카테고리에 걸친 중의적 문장과 그에 대응하는 중의성 해소 이미지를 포함하는 벤치마크인 LaViSA를 소개하며, 현재의 모델들이 어느 정도의 능력을 보여주기는 하지만 여전히 특정 모호성 유형과 미묘한 시각적 차이를 다루는 데 어려움을 겪고 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 말과 새가 있는 사진을 보고 있다고 상상해 보세요. 누군가 당신에게 다음과 같은 메모를 건넵니다. "날고 있는 말과 새(A horse and a bird flying)."
이제, 잠시 멈춰보세요. 이것이 실제로 의미하는 바는 무엇일까요?
- 해석 A: 말도 날고 있고, 새도 날고 있다.
- 해석 B: 말은 땅 위에 서 있고, 새만 날고 있다.
이것은 언어학에서 **구조적 모호성(structural ambiguity)**이라고 부르는 현상입니다. 이 문장은 두 가지 유효한 해결책을 가진 퍼즐이며, 다른 단서가 없다면 어느 쪽이 맞는지 알 수 없습니다. 인간은 이 작업에 매우 능숙합니다. 만약 사진 속의 말이 땅 위에 있는 것을 본다면, 우리 뇌는 즉시 해석 B를 선택합니다.
하지만 AI도 그럴 수 있을까요? 이것이 바로 이 논문, LaViSA가 답하고자 하는 질문입니다.
문제점: AI의 "사각지대"
저자들은 LaViSA(Language and Vision Structural Ambiguity)라는 새로운 테스트를 만들었습니다. 이것은 AI 모델이 눈과 귀를 동시에 연습할 수 있도록 만든 일종의 "체육관"이라고 생각하면 됩니다.
이 체육관에서 AI에게는 다음이 주어집니다:
- 까다로운 문장 (예: 말/새 예시).
- 의미를 명확히 해주는 사진.
- 그 문장이 가질 수 있는 의미들을 나열한 객관식 목록.
AI의 임orant는 사진을 보고, 문장을 읽고, 올바른 의미를 선택하는 것입니다. 이것은 사진이 유일한 힌트가 되는 "이야기 맞히기" 게임과 같습니다.
실험: 누가 테스트를 통과했나?
연구진은 최신 GPT나 Gemini 버전과 같은 매우 똑똑하고 비싼 "독점적(propripleetary)" 모델부터 무료 오픈 소스 모델에 이르기까지 매우 다양한 AI 모델을 테스트했습니다.
그 결과는 다음과 같으며, 이해를 돕기 위해 간단한 비유를 사용하겠습니다:
- "똑똑한" 모델들 (독점적 모델): 이 모델들은 열심히 공부한 학생들과 같습니다. 이들은 특히 "쉬운" 퍼즐에서 매우 잘 수행했습니다. 예를 들어, 문장이 어디에 붙어 있는지에 관한 것이라면 (예: "소년이 호루라기를 가진 소녀를 부른다"), 이들은 사진을 보고 호сто르나 소녀 중 누가 호루라기를 들고 있는지 보통 알아낼 수 있었습니다.
- "고전하는" 모델들 (오픈 소스): 일부 작은 오픈 소스 모델들은 공부가 부족한 학생들과 같았습니다. 이들은 사진이 실사 사진이 아닌 만화 형태일 때 자주 무작위로 찍거나 혼란을 겪었습니다.
- "생각하는" 모델들: 연구진은 답변하기 전에 "생각"하도록 설계된 모델들(풀이 과정을 적는 학생과 같은 모델)도 테스트했습니다. 놀랍게도, 이들이 표준 모델보다 항상 더 나은 성과를 내는 것은 아니었습니다. 때로는 너무 많이 생각하는 것이 오히려 잘못된 길로 빠지게 만들기도 했습니다.
핵심 폭로: AI가 막히는 지점
AI 모델들이 점점 좋아지고는 있지만, 여로 여전히 큰 사각지대를 가지고 있습니다. 논문에 따르면 AI는 *대상(objects)*을 포착하는 데는 뛰어나지만, *관계(relationships)*를 이해하는 데는 서툽니다.
한 소녀, 노트북, 펜, 그리고 책이 있는 장면을 상상해 보세요.
- 문장: "소녀는 노트북 혹은 펜과 책을 들고 있다."
- 함정: 사진 속에서 소녀는 펜과 책을 들고 있습니다. 노트북은 그냥 근처 선반 위에 놓여 있습니다.
- AI의 실수: 노트북이 시각적으로 존재하기 때문에(사진에 바로 옆에 있으므로), AI는 주의가 분산됩니다. AI는 "오, 노트북이 사진에 있네, 그러니 소녀가 그것을 들고 있는 게 틀림없어!"라고 생각합니다. AI는 '들고 있다'가 단순히 '근처에 있는 것'이 아니라 특정한 동작임을 이해하지 못합니다.
논문은 이를 접속사 범위(Conjunction Scope)(단어들을 함께 묶는 것)와 **생략(Ellipsis)**의 문제라고 부릅니다.
- 접속사 범위: AI는 문장에 "또는(or)"과 "그리고(and)"가 있을 때 어떤 항목이 어떤 동작에 속하는지 파악하지 못합니다.
- 생략: 만약 문장이 "사자가 닭을 먹는다. 또한 고양이도"라고 한다면, AI는 고양이도 닭을 먹고 있는 것인지, 아니면 고양이가 그냥 먹히고 있는 것인지 파악하는 데 어려움을 겪습니다. AI는 시각적 세부 사항에 매몰되어 문법을 놓치게 됩니다.
결론
논문은 시각적 장면이 AI가 언어를 이해하는 데 강력한 도구가 된다고 결론짓습니다. 사진이 명확할 때, AI는 종종 퍼즐을 풀 수 있습니다.
하지만 AI는 여전히 랜드마크는 알아볼 수 있지만 현지 문화는 이해하지 못하는 관광객과 같습니다. AI는 사진 속의 물체들을 보지만, 그것들을 문장의 올바른 "이야기"와 연결하는 데는 자주 실패합니다. AI는 "물체가 저기에 있다고 해서, 반드시 문장이 설명하는 동작을 하고 있는 것은 아니다"라는 점을 이해하는 데 어려움을 겪습니다.
저자들은 AI 모델이 정확히 어느 부분에서 실패하고 있는지를 보여주기 위해 이 벤치마크를 구축했으며, 이를 통해 미래의 연구자들이 AI가 표면적인 이미지를 넘어 더 깊이 있게 바라볼 수 있도록 가르칠 수 있기를 바라고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.