← Últimos artículos
💬 NLP

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

Este artículo presenta GSM-Plus-BN, un nuevo referente basado en perturbaciones para el razonamiento matemático en bengalí derivado del conjunto de datos inglés GSM-Plus, para evaluar la robustez y las capacidades de razonamiento de seis grandes modelos de lenguaje, al tiempo que destaca las brechas de rendimiento significativas y los desafíos inherentes a los contextos de lenguas con bajos recursos.

Autores originales: Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

Publicado 2026-07-16
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a resolver problemas matemáticos. No le pedirías simplemente que calcule 2+22 + 2; querrías saber si realmente entiende por qué la respuesta es 4, o si solo ha memorizado que "2 más 2" siempre es igual a 4. Esta es la gran pregunta en el mundo de la Inteligencia Artificial: ¿los Modelos de Lenguaje Extensos (LLM) —los cerebros informáticos superinteligentes detrás de los chatbots— realmente "piensan", o solo son muy buenos adivinando la siguiente palabra en una oración?

Para averiguarlo, los científicos han estado probando a estos robots con problemas matemáticos de razonamiento. Pero aquí está el truco: si le haces al robot exactamente la misma pregunta mil veces, podría simplemente memorizar la respuesta. Para ver si es verdaderamente inteligente, tienes que engañarlo. Cambias los números, cambias las palabras o añades detalles confusos y extra para ver si el robot sigue obteniendo la respuesta correcta. Esto se llama "perturbación". Es como preguntarle a un estudiante: "Si tengo 3 manzanas y me como 1, ¿cuántas quedan?", y luego, un segundo después, preguntar: "Si tengo 300 manzanas y me como 100, ¿cuántas quedan?". Un estudiante inteligente sabe que la matemática es la misma; un robot que solo memorizó la primera respuesta podría confundirse.

Ahora, imagina hacer todo esto, pero no en inglés, el idioma en el que la mayoría de los robots están entrenados, sino en bengalí, un idioma hablado por más de 230 millones de personas. Hasta ahora, casi no había forma de probar si estos cerebros de IA podían manejar trucos matemáticos en bengalí. Este artículo interviene para llenar ese enorme vacío, preguntando: ¿Pueden estos modelos de IA razonar realmente en bengalí, o simplemente tropiezan cuando las palabras cambian?


Los investigadores detrás de este estudio, un equipo de universidades de Bangladesh, decidieron construir un patio de juegos gigante y truculento para la IA llamado GSM-PLUS-BN. Piensa en esto como un "Circuito de Obstáculos Matemáticos" diseñado específicamente para el idioma bengalí. Comenzaron con un conjunto de 1,000 problemas matemáticos estándar (las preguntas "semilla") y luego utilizaron una receta ingeniosa para crear 8,000 versiones nuevas y más complicadas de ellos.

¿Cómo crearon estos trucos? Utilizaron ocho tipos diferentes de "distorsiones", como un mago cambiando una carta en un mazo:

  1. Cambiar los Números: Intercambiar un "3" por un "4" o convertir un número pequeño en uno enorme (como convertir 2 en 2,000).
  2. Cambiar la Matemática: Añadir un nuevo paso al problema o darle la vuelta a la pregunta (en lugar de preguntar "¿Cuál es el total?", preguntar "¿Si el total es X, cuál era el número inicial?").
  3. Cambiar las Palabras: Reescribir la oración para que signifique lo mismo pero suene totalmente diferente.
  4. La "Pista Falsa" (Red Herring): Añadir una frase que parece importante pero que en realidad es inútil, como mencionar el precio de una camisa cuando la pregunta es solo sobre cuántas camisas necesitas.
  5. La "Pieza Faltante": Eliminar una pieza crucial de información para ver si el robot admite que no sabe la respuesta o si simplemente adivina de todos modos.

Probaron seis modelos de IA diferentes en este circuito. Algunos eran pequeños y rápidos (como una calculadora inteligente), mientras que otros eran masivos y complejos (como un cerebro de supercomputadora). Les pidieron a los robots que resolvieran los problemas de dos maneras: primero, dando solo una respuesta directa, y segundo, "pensando paso a paso" (una técnica llamada Cadena de Pensamiento o Chain-of-Thought, donde el robot tiene que mostrar su procedimiento).

¿Qué descubrieron?

Los resultados fueron una mezcla de "¡Guau!" y "¡Uh-oh!".

Primero, el truco de "pensar paso a paso" funcionó de maravilla para algunos robots, pero fue contraproducente para otros. El modelo Qwen3-32B era como un estudiante que era pésimo en matemáticas hasta que el profesor le dice: "¡Muestra tu procedimiento!". De repente, su puntuación saltó de un lúgubre 13.98% a un sólido 76.25%. Parece que este modelo tenía el potencial de ser inteligente, pero necesitaba un pequeño empujón para desbloquearlo.

Sin embargo, los robots más grandes no siempre obtuvieron los mayores impulsos. El GPT-OSS-20B (el modelo de 20 mil millones de parámetros) fue en realidad el mejor resolviendo las preguntas estándar sin ayuda adicional, acertando el 96.08%. Pero cuando se le obligó a "pensar paso a paso", en realidad empeoró ligeramente, cayendo al 87.80%. Mientras tanto, el gigante GPT-OSS-120B comenzó con un fuerte 88.03% en las preguntas estándar y también experimentó una ligera caída al pedirle que mostrara su trabajo. Parece que estos gigantes eran tan buenos adivinando la respuesta directamente que las instrucciones adicionales a veces los confundían.

El descubrimiento más sorprendente fue lo difícil que resultaron los trucos de "Pensamiento Crítico" para los robots. Cuando los investigadores eliminaron una pieza clave de información y preguntaron: "¿Puedes resolver esto?", casi todos los modelos fallaron estrepitosamente. Incluso los mejores solo acertaron alrededor del 33%. Esto sugiere que, aunque estos modelos de IA son excelentes siguiendo patrones, todavía luchan por darse cuenta de cuándo un problema es irresoluble. Tienden a adivinar de todos modos en lugar de decir: "No tengo suficiente información".

Otro gran hallazgo fue que las matemáticas siguen siendo difíciles para la IA, sin importar el idioma. Incluso los mejores modelos tuvieron dificultades con problemas que requerían cambiar cómo se escribían los números (como convertir números enteros en fracciones) o añadir pasos matemáticos extra. El artículo sugiere que estos modelos podrían estar dependiendo demasiado del reconocimiento de patrones en el texto en lugar de hacer la matemática real en sus "cabezas".

Finalmente, el equipo encontró que los modelos de IA eran mucho más frágiles en bengalí de lo que lo son en inglés. Cuando las preguntas cambiaban ligeramente, las puntuaciones de los robots caían significativamente. Esto nos dice que, aunque la IA se está volviendo más inteligente, todavía tiene un largo camino por recorrer antes de que pueda realmente "entender" las matemáticas en idiomas como el bengalí de la misma manera que lo hace un humano.

En resumen, este artículo no solo construyó una nueva prueba; nos mostró que, si bien la IA puede ser sorprendentemente buena en matemáticas, todavía es fácilmente confundida por los trucos, especialmente en idiomas que no ha dominado tan bien como el inglés. El truco de "pensar paso a paso" ayuda a algunos, pero no es una varita mágica que lo arregle todo. Los robots están mejorando, pero aún no están listos para ser los genios matemáticos definitivos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →