← Últimos artículos
💻 computer science

Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity

Aunque los modelos de lenguaje de gran tamaño se alinean con los humanos en la interpretación superficial del diálogo, divergen significativamente a nivel representacional, particularmente al procesar lenguaje figurado dependiente del contexto y sociopragmático como modismos, jerga y sarcasmo, siendo GPT-4 el que demuestra la aproximación más cercana a los patrones humanos entre los modelos probados.

Autores originales: Samhita Bollepally, Aurora Sloman-Moll, Takashi Yamauchi

Publicado 2026-01-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Samhita Bollepally, Aurora Sloman-Moll, Takashi Yamauchi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo entender los chistes, el sarcasmo y la jerga de los humanos. Le muestras una frase como, "Esta comida es gas" (esta comida es genial), y le preguntas: "¿Es esto divertido?" o "¿Es esto positivo?".

Un nuevo estudio realizado por investigadores de la Universidad de Texas A&M plantea una pregunta difícil: Cuando el robot da la misma respuesta que un humano, ¿realmente piensa de la misma manera que un humano?

Aquí está el desglose de sus hallazgos, utilizando algunas analogías cotidianas.

El Experimento: La "Prueba de Sabor"

Los investigadores organizaron una enorme prueba de sabor, pero en lugar de helado, usaron 240 frases diferentes. Estas frases cubrían seis "sabores" del lenguaje:

  1. Convencional: Oraciones normales (p. ej., "El perro está afuera").
  2. Idiomático: Frases donde las palabras no significan lo que dicen (p. ej., "Morder la bala").
  3. Emocional: Oraciones llenas de sentimientos.
  4. Divertido: Chistes y juegos de palabras.
  5. Sarcástico: Decir lo contrario de lo que quieres decir.
  6. Jerga de la Generación Z: Lenguaje moderno de internet (p. ej., "Esta comida es gas").

Pidieron a 211 humanos y a cuatro modelos de IA diferentes (incluyendo GPT-4, Llama y Mistral) que calificaran cada frase en 40 preguntas diferentes, como "¿Es esto positivo?" o "¿Es esto preocupante?", en una escala del 1 al 10.

Las Dos Formas de Comparar: El "Marcador" vs. El "Mapa"

Los investigadores analizaron los resultados de dos maneras muy diferentes:

1. Similitud Superficial (El Marcador)
Esto es como mirar el marcador final de un partido de fútbol. Si la IA dice "8/10" para un chiste y un humano dice "8/10", parece que están de acuerdo.

  • El Hallazgo: En este nivel, los modelos de IA, especialmente el más inteligente (GPT-4), parecían muy humanos. Dieron puntuaciones similares a los humanos para la mayoría de las frases. Parecía que estaban en el mismo equipo.

2. Similitud Representacional (El Mapa)
Esta es la parte más profunda. Imagina que tú y un amigo están dibujando el mapa de una ciudad.

  • Mapa Humano: Tú sabes que la "Pizzería" está justo al lado del "Parque", y que la "Escuela" está lejos del "Cementerio". Tu mapa tiene una estructura específica basada en cómo entiendes el mundo.
  • Mapa de la IA: La IA también podría poner la "Pizzería" y el "Parque" cerca, pero por las razones equivocadas. Tal vez piensa que están cerca porque ambos tienen la palabra "lugar", no por cómo funcionan en la vida real.

Los investigadores utilizaron una herramienta matemática llamada Análisis de Similitud Representacional (RSA) para comparar la estructura de estos mapas. No solo verificaron si las puntuaciones coincidían; verificaron si las relaciones entre las frases eran las mismas.

La Gran Revelación: El Efecto "Impostor"

Esto es lo que encontraron:

  • La Superficie es Engañosa: Los modelos de IA eran muy buenos imitando las puntuaciones humanas. Si preguntabas "¿Es esto sarcástico?", la IA a menudo decía "Sí", tal como lo haría un humano.
  • El Mapa es Diferente: Cuando los investigadores observaron los "mapas" subyacentes, la IA y los humanos estaban en realidad bastante alejados. La IA organizaba el significado de las frases de manera diferente a los humanos.

La Analogía:
Piensa en la IA como un loro muy talentoso.

  • Si le preguntas al loro "¿Es esta frase divertida?", puede decir "Sí" perfectamente, igual que un humano.
  • Pero el loro no entiende realmente el chiste. Solo sabe que cuando los humanos escuchan este patrón específico de palabras, suelen decir "Sí".
  • El humano, sin embargo, entiende el chiste porque entiende el contexto social, el tono y el significado oculto.

Los Resultados por "Sabor"

El estudio encontró que las "habilidades de loro" de la IA funcionaban mejor para algunos tipos de lenguaje que para otros:

  • Oraciones Emocionales y Convencionales: El mapa de la IA era algo similar al mapa humano. Es más fácil adivinar que "Estoy triste" es negativo que adivinar que "Estoy tan emocionado que voy a regar mis plantas" es divertido.
  • Modismos, Sarcasmo y Jerga: Aquí es donde la IA falló la "Prueba del Mapa".
    • Modismos: Cuando los humanos escuchan "Rómpete una pierna", saben que significa "Buena suerte". La IA a menudo luchaba por mapear esto correctamente al concepto de "buena suerte" sin confundirse con las palabras literales "romper" y "pierna".
    • Sarcasmo y Jerga: Estos dependen en gran medida del contexto social y de las experiencias humanas compartidas (como la jerga de la Generación Z). El mapa interno de la IA para estos era muy diferente del mapa humano. Era como si la IA estuviera hablando un idioma diferente, aunque las palabras parecieran las mismas.

El "Gran Cerebro" vs. El "Pequeño Cerebro"

El estudio comparó diferentes modelos de IA:

  • GPT-4: Este era el "gran cerebro". Tenía el mapa más similar al de los humanos, pero aun así no era una coincidencia perfecta. Era lo más parecido a un humano, pero seguía teniendo brechas.
  • Modelos más Pequeños (Llama, Mistral): Estos estaban más alejados. Sus mapas eran muy diferentes a los de los humanos, especialmente cuando se trataba de temas complicados como el sarcasmo y la jerga.

La Conclusión

El artículo concluye que el hecho de que una IA dé la misma respuesta que un humano no significa que entienda el lenguaje de la misma manera.

La IA es excelente en el reconocimiento de patrones (imitando el marcador), pero carece del "anclaje" profundo, social y contextual que poseen los humanos. Organiza el significado de su propia manera única, lo cual funciona bien para tareas sencillas, pero falla cuando el lenguaje se vuelve complicado, emocional o culturalmente específico.

En resumen: La IA es un actor muy bueno que puede decir las líneas correctas, pero no necesariamente siente las emociones que hay detrás de ellas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →