← Últimos artículos
💬 NLP

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

Este artículo evalúa ocho modelos de lenguaje multimodal avanzados en su capacidad para detectar y explicar significados figurados en memes, revelando que, aunque algunos logran predicciones correctas, todos muestran un sesgo hacia atribuir significados figurados inexistentes y a menudo generan explicaciones que no son fieles al contenido original.

Autores originales: Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

Publicado 2026-03-25
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que los memes de internet son como chistes visuales. A veces, un meme parece una foto normal con un texto, pero en realidad esconde un significado oculto, como una broma interna, una ironía o una metáfora. Es como si alguien te dijera "hoy hace un calor de infierno" y no se refiera al clima, sino a que su jefe es muy estricto.

Los investigadores de este papel se preguntaron: ¿Pueden las nuevas "super-inteligencias" artificiales (llamadas Modelos de Lenguaje Multimodales) entender estos chistes complejos?

Aquí tienes la explicación de su investigación, traducida a un lenguaje sencillo con analogías:

1. La Misión: ¿Entienden los robots el sarcasmo?

Los autores tomaron a 8 de los mejores modelos de IA actuales (como si fueran 8 estudiantes muy inteligentes) y les mostraron miles de memes. Les pidieron dos cosas:

  1. Detectar: ¿Este meme tiene un significado oculto (broma, ironía, metáfora)?
  2. Explicar: ¿Por qué piensas eso? (Como si el estudiante tuviera que justificar su respuesta en un examen).

2. El Hallazgo Principal: ¡Los robots son demasiado "creativos"!

El descubrimiento más divertido es que los robots tienen un sesgo enorme.

  • La analogía: Imagina a un perro que cree que todo lo que ve es un hueso. Si le muestras una piedra, un zapato o una pelota, el perro olfateará y dirá: "¡Hueso!".
  • Lo que pasó: Las IAs tienden a creer que casi todos los memes tienen un significado oculto. Incluso cuando un meme es literal y serio, la IA suele decir: "¡Ah, esto es una metáfora!". Les cuesta mucho distinguir entre lo que es una broma real y lo que es una foto normal.

3. ¿Qué miran más: los ojos o el cerebro?

Los investigadores hicieron un experimento interesante:

  • Opción A: Mostrar solo la imagen (sin texto).
  • Opción B: Mostrar solo el texto (sin imagen).
  • Opción C: Mostrar todo junto.

El resultado:

  • Para entender la ironía o el sarcasmo, la IA necesita ver la imagen. Es como entender una cara de "no me lo creo" sin leer lo que dice la persona.
  • Para entender las metáforas, la IA necesita ambos. Es como intentar armar un rompecabezas: si te falta la mitad de las piezas (solo texto o solo imagen), no puedes ver la imagen completa.
  • Para cosas como la hipérbole (exageración), a veces el texto es suficiente, pero la imagen ayuda a confirmar la locura.

4. El Problema de las "Alucinaciones" (Explicaciones falsas)

Aquí es donde la cosa se pone seria. Aunque a veces la IA acierta en la respuesta (dice "sí, es sarcasmo"), su explicación suele ser un desastre.

  • La analogía: Imagina a un niño que adivina la respuesta correcta en un examen ("¡La capital es París!"), pero cuando el profesor le pide explicar por qué, el niño inventa una historia falsa: "Porque vi un dibujo de una torre en un libro de cocina".
  • Lo que pasó: Las IAs a menudo alucinan. Inventan detalles que no existen en la imagen o malinterpretan lo que ven. Por ejemplo, vieron un dedo frente a la boca de un gato y dijeron que era un "gesto de silencio humano", cuando en realidad el dedo solo le estaba levantando la nariz al gato.

5. ¿Son los robots mejores si son más grandes?

Sí, pero con matices. Los modelos más grandes (con más "cerebro" o parámetros) generalmente lo hacen mejor, pero siguen cometiendo errores humanos. A veces, la IA da una respuesta que es técnicamente "incorrecta" según los humanos, pero su explicación es tan lógica y bien fundamentada que te hace pensar: "Bueno, quizás el meme es ambiguo y la IA tiene un punto".

En resumen:

Este estudio nos dice que, aunque las IAs son increíbles leyendo y viendo, aún no tienen el "sentido común" ni la experiencia social para entender perfectamente el humor humano en internet.

  • Lo bueno: Pueden detectar muchos tipos de chistes.
  • Lo malo: A veces ven fantasmas donde no los hay (exceso de confianza) y, cuando explican sus respuestas, a veces inventan cosas que no están en la foto.

La lección final: No confíes ciegamente en la IA para entender el humor o el sarcasmo todavía; a veces, el "sentido común" humano sigue siendo el mejor traductor de memes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →