← Últimos artículos
💬 NLP

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS es un nuevo conjunto de pruebas multilingüe diseñado para evaluar el rendimiento y la seguridad de los sistemas de IA agentes en diversos idiomas, revelando que la transición del inglés a otras lenguas suele degradar tanto su capacidad de ejecución como su robustez ante riesgos de seguridad.

Autores originales: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

Publicado 2026-02-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El problema: El "Efecto Traductor" en la Inteligencia Artificial

Imagina que contratas a un asistente personal súper inteligente para que te ayude con todo: desde arreglar errores en tu computadora hasta reservar vuelos o resolver problemas matemáticos complejos. Este asistente es increíblemente eficiente cuando le hablas en inglés. Es rápido, preciso y no comete errores.

Pero, de repente, decides hablarle en español, hindi o árabe.

Lo que sucede no es que el asistente "olvide" cómo trabajar, sino que, al intentar procesar un idioma distinto, su cerebro digital se confunde. Es como si, al cambiar de idioma, el asistente tuviera que usar un par de gafas empañadas: de repente, sus planes se vuelven torpes, comete errores de lógica y, lo más peligroso, se vuelve menos cuidadoso con tu seguridad.

¿Qué es MAPS? (La "Prueba de Resistencia" Multilingüe)

Los investigadores crearon MAPS, que es como un examen de conducir extremo diseñado específicamente para ver qué tan buenos son estos asistentes cuando no se les habla en inglés.

En lugar de hacerles preguntas simples de "sí o no", los pusieron a realizar tareas reales y difíciles en 12 idiomas diferentes:

  1. Tareas del mundo real: Como navegar por internet para buscar información.
  2. Programación: Como arreglar códigos de software.
  3. Matemáticas: Resolver problemas complejos.
  4. Seguridad: Ver si el asistente puede ser engañado para hacer algo peligroso (como dar acceso a datos privados).

Los descubrimientos: ¿Qué salió mal?

El estudio reveló tres cosas muy importantes usando una analogía que todos conocemos: la diferencia entre un manual de instrucciones y una conversación.

1. El "Peso" de las palabras (La analogía del Chef)

Imagina a un chef que sigue una receta.

  • Si la receta es de matemáticas o código, es como una lista de ingredientes: "2 huevos, 200g de harina". No importa si la lista está en inglés o en español, los números y los símbolos son casi iguales. Por eso, en matemáticas, la IA no falló tanto.
  • Pero si la tarea es de asistencia general (como GAIA), es como una receta que dice: "Añade una pizca de sal cuando el aroma sea dulce y la textura sea suave". Aquí, el lenguaje es sutil y lleno de matices. Si la traducción falla un poco, el chef se confunde y arruina el plato. En las tareas que dependen mucho del lenguaje natural, la IA se desplomó.

2. El "Escudo de Seguridad" se vuelve de papel

Este es el hallazgo más preocupante. Los investigadores descubrieron que los "hackers" o las instrucciones malintencionadas funcionan mucho mejor cuando se usan otros idiomas.
Es como si el asistente tuviera un guardaespaldas que habla inglés perfectamente y detecta cualquier amenaza, pero cuando el asistente habla en otro idioma, el guardaespaldas se queda dormido. Esto significa que un usuario podría engañar a una IA para que haga algo inseguro simplemente usando un idioma que no sea el inglés.

3. El problema no es la traducción, es el "razonamiento"

Los científicos intentaron ayudar a la IA traduciendo todo al inglés antes de que lo procesara (como ponerle un intérprete al lado). Aunque esto ayudó un poco, no solucionó el problema por completo.
Esto nos dice que el fallo no es solo que la traducción sea "fea", sino que la capacidad de la IA para pensar y planificar pasos lógicos se debilita cuando sale de su zona de confort (el inglés).

¿Por qué debería importarnos esto?

Si queremos que la Inteligencia Artificial sea realmente para todos y no solo para quienes hablan inglés, no basta con que "entienda" las palabras. Necesitamos que sea igual de inteligente, igual de capaz y, sobre todo, igual de segura en todos los idiomas.

MAPS es el primer mapa que nos muestra dónde están esos baches en el camino para que los desarrolladores puedan arreglarlos antes de que la IA llegue a nuestras casas y oficinas en todo el mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →