← 최신 논문
💬 NLP

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

이 논문은 8 개의 최첨단 멀티모달 대규모 언어 모델 (MLLM) 을 대상으로 밈의 비유적 의미를 탐지하고 설명하는 능력을 평가한 결과, 모든 모델이 실제 비유적 의미가 없는 경우에도 이를 과잉 인식하는 편향을 보이며, 정확한 예측이 반드시 신뢰할 수 있는 설명으로 이어지지 않음을 발견했습니다.

원저자: Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

게시일 2026-03-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 1. 연구의 배경: AI 는 왜 밈을 못 알아볼까?

인터넷 밈은 **사진 (이미지)**과 **글자 (텍스트)**가 섞여 있어, 표면적인 뜻이 아닌 농담, 풍자, 비유 같은 '숨은 뜻'을 담고 있습니다.
예를 들어, "내가 왔고, 보았고, 불평했다"라는 밈은 카이사르의 "정복했다"는 명언을 비꼬는 유머입니다.

연구진은 최신 AI 모델 8 개를 데려와 이 밈들을 보고 **"이게 비유적인 뜻이 있니? 있다면 왜 그런지 설명해 봐"**라고 물었습니다. 마치 요리사 (AI) 가 손님이 준 재료 (밈) 를 보고 "이건 매운 요리야 (비유적 의미)"라고 맞히고, 그 이유를 설명하는 상황과 같습니다.

🔍 2. 주요 발견: AI 의 세 가지 '요리 실수'

연구 결과, AI 요리사들은 몇 가지 재미있는 실수를 반복했습니다.

① "무조건 비유일 거야!" (과도한 비유화 경향)

AI 는 밈이라는 형태만 보면, 사실은 그냥 평범한 이야기인데도 무조건 "이건 비유겠지?"라고 착각했습니다.

  • 비유: 마치 소금기 많은 음식을 본 순간, "아, 이건 무조건 짠맛이겠지?"라고 생각해서 달콤한 디저트에도 소금을 뿌리는 것과 같습니다. 밈이라는 '포장지'만 보고 내용을 제대로 읽지 못했습니다.

② "눈과 귀의 불균형" (모달리티 편향)

밈의 비유적 의미를 파악할 때, AI 는 어떤 정보를 더 믿는지에 따라 실력이 달라졌습니다.

  • 눈 (이미지) 을 더 믿는 경우: '아이러니 (반어)'나 '풍자' 같은 것은 그림의 분위기나 표정을 보면 바로 알 수 있습니다. AI 도 그림을 보면 잘 알아냈습니다.
  • 귀 (텍스트) 를 더 믿는 경우: '은유'나 '과장' 같은 것은 글자의 뉘앙스를 파악해야 합니다.
  • 혼합 요리 실패: 하지만 **'은유 (Metaphor)'**는 그림과 글자가 서로 연결되어야만 이해할 수 있습니다. AI 는 이 두 가지를 잘 섞지 못해, 그림만 보거나 글자만 보면 완전히 엉뚱한 소리를 했습니다.

③ "설명할 때 궤변을 부린다" (신뢰성 부족)

가장 큰 문제는 정답을 맞췄더라도, 그 이유를 설명할 때 엉뚱한 소리를 했다는 점입니다.

  • 비유: AI 가 "이 요리는 매운맛이야 (정답)"라고 맞혔지만, 설명을 들어보면 **"이 요리에는 고추가 들어있어서 매운 거야"**라고 말했는데, 실제로는 고추가 없었습니다.
  • 현실: AI 는 그림 속 고양이가 입을 벌린 것을 보고 "고양이가 입을 막고 있어 (침묵의 상징)"라고 엉뚱하게 해석하거나, 밈의 사회적 맥락 (사람들이 왜 웃는지) 을 전혀 이해하지 못했습니다.

🧪 3. 실험 방법: "재료를 뺀 요리"

연구진은 AI 의 실력을 더 정확히 보기 위해 재료를 일부러 빼는 실험을 했습니다.

  • 원래 밈: 그림 + 글자
  • 글자만 남김: 그림에서 글자를 지우고 글자만 줌.
  • 그림만 남김: 글자를 지우고 그림만 줌.

그 결과, **은유 (Metaphor)**를 이해하려면 그림과 글자가 모두 필요하다는 것이 밝혀졌습니다. 반대로 **풍자 (Sarcasm)**는 그림만 봐도 어느 정도 감이 왔습니다.

💡 4. 결론: AI 는 아직 '인간적인 유머'를 모른다

이 연구는 현재 AI 가 밈을 해석하는 데는 한계가 있음을 보여줍니다.

  1. 과도한 의심: 밈을 보면 무조건 비유라고 의심합니다.
  2. 설명 능력 부족: 정답을 맞혀도, 그 이유를 설명할 때 그림을 잘못 보거나 (환각), 사회적 맥락을 모릅니다.
  3. 다양한 비유: 어떤 비유는 그림을, 어떤 비유는 글을 더 잘 봐야 하는데, AI 는 이를 상황에 따라 유연하게 섞지 못합니다.

🚀 5. 앞으로의 과제

이 논문은 AI 개발자들에게 **"단순히 정답을 맞히는 것 (점수) 이 아니라, 왜 그런지 인간처럼 논리적으로 설명할 수 있어야 한다"**고 경고합니다.

마치 **요리사에게 "이 요리를 잘 만들었으니 점수 100 점 줄게"라고 하는 게 아니라, "왜 이 요리가 맛있는지, 어떤 재료가 어떻게 어우러졌는지 설명할 수 있어야 진정한 요리사다"**라고 말하는 것과 같습니다.

이 연구를 통해 앞으로는 밈뿐만 아니라, 복잡한 인간 감성과 유머를 이해하는 더 똑똑하고 신뢰할 수 있는 AI를 만드는 데 중요한 발걸음이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →