← Últimos artículos
💬 NLP

Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource Languages

Este artículo presenta MIDI, un nuevo conjunto de datos multilingüe que abarca lenguas de altos, medios y bajos recursos que integra modismos en contextos de oraciones y conversaciones para revelar que los modelos actuales tienen dificultades significativas con las interpretaciones literales y las lenguas de bajos recursos, incluso cuando se les proporcionan pistas contextuales.

Autores originales: Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao B, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein
Publicado 2026-06-02
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao B, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein Yari, Hawau Olamide Toyin, Nurdaulet Mukhituly, Mena Attia, Besher Hassan, Ahmad Fathan Hidayatullah, Tatsuki Kuribayashi, Haonan Li, Suma Bhat, Fajri Koto

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a entender la conversación humana. Le das un diccionario y miles de libros, y aprende a hablar muchos idiomas con fluidez. Pero luego, le haces una pregunta sencilla: "¿Qué significa cuando alguien dice que está 'lloviendo gatos y perros'?"

Si el robot responde: "Está lloviendo animales literalmente", ha fallado. Ha pasado por alto el modismo (idiom)—una frase donde las palabras significan algo totalmente distinto a su definición literal.

Este artículo presenta una nueva herramienta llamada MIDI (Multilingual Idiom Dataset) para probar qué tan bien manejan estas frases complicadas los modelos de IA modernos en 18 idiomas diferentes, que van desde lenguas globales importantes (como el chino y el japonés) hasta lenguas con menor presencia digital (como el yoruba y el javanés).

Aquí tienes un desglose de lo que descubrieron los investigadores, utilizando analogías sencillas:

1. El Problema: La "Trampa Literal"

Los modismos son como bromas culturales internas. Para entenderlos, no puedes simplemente buscar las palabras; necesitas conocer el "vibe" o la esencia de la cultura.

  • El Estudio: Los investigadores construyeron un enorme banco de pruebas (MIDI) con más de 2,000 modismos. No solo le dieron a la IA la frase; la colocaron en dos entornos diferentes:
    • La Oración: Una sola línea de texto (como una ficha de estudio).
    • La Conversación: Un breve chat entre dos personas (como una escena de una película).
  • El Objetivo: Ver si la IA puede distinguir entre una frase usada de forma figurada (el significado de la broma) y de forma literal (el significado real).

2. Los Resultados: La Brecha "Rico vs. Pobre"

Los investigadores probaron los modelos de IA más inteligentes disponibles (tanto los costosos y "propietarios" como los gratuitos y de "código abierto").

  • La División Lingüística: Piensa en los recursos lingüísticos como el ancho de banda de internet.
    • Lenguas de Altos Recursos (ej. inglés, chino): Estos idiomas tienen una enorme cantidad de datos en internet. Los modelos de IA se desempeñaron decentemente aquí, como un estudiante que ha leído muchos libros de texto.
    • Lenguas de Bajos Recursos (ej. yoruba, minangkabau): Estos idiomas tienen muy pocos datos en línea. Los modelos tuvieron serios problemas aquí, a menudo rindiendo no mejor que el azar. Es como pedirle a un estudiante que tome un examen en un idioma que nunca ha visto.
  • La Lucha Literal: Incluso los mejores modelos encontraron que los significados literales eran mucho más difíciles que los figurados.
    • Analogía: Si dices, "romper una pierna" (breaking a leg), la IA es buena sabiendo que quieres decir "buena suerte" (figurado). Pero si dices, "estoy rompiendo una pierna" mientras estás realmente en un hospital, la IA suele confundirse y sigue pensando que quieres decir "buena suerte". Le cuesta darse cuenta de cuándo la broma no es una broma.

3. La Prueba de "Memoria" vs. "Razonamiento"

Los investigadores querían saber: ¿La IA está realmente pensando, o solo está memorizando respuestas como un loro?

  • La Prueba de Memoria: Le preguntaron a la IA, "¿Qué significa esta frase?" sin contexto.
    • Resultado: Los modelos grandes y caros fueron excelentes en esto. Habían "memorizado" las definiciones.
  • La Prueba de Razonamiento: Le dieron a la IA la frase más la definición en inglés y le pidieron que eligiera el significado correcto basándose en la historia.
    • Resultado: Esto ayudó mucho a los modelos de código abierto, pero la brecha entre las lenguas "ricas" y las "pobres" persistió.
  • El Descubrimiento del "Sesgo": La IA tiene un fuerte sesgo hacia las bromas. En caso de duda, asume que la frase es figurada.
    • Analogía: Es como una persona que siempre asume que estás bromeando, incluso cuando estás hablando en serio. Esto los hace buenos detectando modismos, pero terribles para detectar cuándo alguien está siendo literal.

4. El Experimento de "Direccionamiento" (El Control Remoto)

Los investigadores probaron un truco genial llamado Direccionamiento de Activación (Activation Steering). Imagina que el cerebro de la IA es una radio, y descubrieron un "botón" específico que controla si la IA está pensando en "datos memorizados" o en "razonamiento lógico".

  • Qué hicieron: Giraron este botón ligeramente para empujar a la IA hacia un mejor razonamiento.
  • El Resultado: ¡Funcionó! La IA mejoró un poco, especialmente para las lenguas de bajos recursos. Es como darle a un estudiante una pequeña pista o un empujoncito en la dirección correcta, lo que le ayudó a resolver el rompecabezas en el que estaba atascado. Curiosamente, descubrieron que un "botón" entrenado con un conjunto de datos completamente diferente (MMLU-Pro) funcionaba igual de bien en esta prueba de modismos, lo que sugiere que la forma en que la IA maneja la memoria y el razonamiento es un "músculo" universal a través de diferentes tareas.

5. Humanos vs. Máquinas

Finalmente, pidieron a humanos reales que realizaran la misma prueba.

  • La Puntuación: Los humanos obtuvieron un 94% de aciertos.
  • La Puntuación de la IA: Los mejores modelos de IA obtuvieron alrededor de un 81% (propietarios) y un 72% (código abierto).
  • La Brecha: La mayor diferencia fue en las lenguas de bajos recursos. Por ejemplo, en yoruba, el mejor modelo de código abierto obtuvo solo un 23%, mientras que los humanos obtuvieron un 96%.

Resumen

El artículo concluye que, si bien la IA se está volviendo muy buena en los idiomas, todavía lucha con el "alma" del lenguaje: los modismos.

  • Depende demasiado de la memorización.
  • Se confunde cuando una frase debe tomarse de forma literal.
  • Tiene un desempeño deficiente en lenguas donde no ha visto suficientes datos.
  • Incluso los modelos más inteligentes siguen estando muy por detrás de los humanos en la comprensión de los matices de las expresiones culturales.

Los investigadores no pretendían que esto arreglara inmediatamente las aplicaciones de traducción o creara nuevas herramientas médicas. Simplemente construyeron un mejor "gimnasio" (el conjunto de datos MIDI) para mostrarnos exactamente dónde es débil la IA, de modo que podamos construir modelos más fuertes en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →