← Últimos artículos
💬 NLP

PatiGonit22K: A Comprehensive Dataset for Solving Complex Bengali MWPs

Este artículo presenta PatiGonit22K, un conjunto de datos exhaustivo y culturalmente adaptado de 22.441 problemas matemáticos de palabras en bengalí anotados, diseñado para avanzar la investigación en el razonamiento matemático y el procesamiento de lenguaje natural educativo para lenguas de bajos recursos.

Autores originales: Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad

Publicado 2026-07-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras son como estudiantes brillantes y hambrientos de conocimiento que pueden leer casi cualquier idioma de la Tierra, pero que tienen dificultades cuando se trata de resolver problemas matemáticos de texto en idiomas que no han estudiado mucho. Este es el patio de recreo de la "Comprensión del Lenguaje Natural", una rama de la ciencia donde enseñamos a las máquinas no solo a reconocer palabras, sino a comprender las historias ocultas dentro de ellas y los números que esas historias describen. Durante mucho tiempo, estos estudiantes informáticos han tenido bastantes libros de práctica en inglés y chino, pero para idiomas como el bengalí, hablado por cientos de millones de personas, la biblioteca estaba casi vacía. Sin suficientes problemas de práctica, las computadoras no podían aprender a razonar a través de preguntas complicadas como: "Si Rachel compra 7 sillas y 3 mesas, y toma 4 minutos ensamblar cada una, ¿cuánto tiempo toma todo el trabajo?". Este artículo se adentra en esa biblioteca vacía para construir un nuevo y masivo libro de práctica, diseñado específicamente para ayudar a las computadoras a volverse más inteligentes al resolver acertijos matemáticos en bengalí.

Los autores de este artículo, un equipo de investigadores de universidades de Dhaka, Bangladesh, notaron que, si bien existía una colección previa de problemas matemáticos en bengalí, era un poco demasiado simple. Era como un gimnasio con solo mancuernas ligeras; ayudaba a los principiantes, pero no podía entrenar los músculos computacionales necesarios para levantar pesas pesadas. Para solucionar esto, introdujeron PatiGonit22K, un nuevo y expandido conjunto de datos que contiene 22,441 problemas matemáticos de texto. Piensa en este conjunto de datos como un gigante y cuidadosamente curado cofre del tesoro de acertijos. El equipo no solo hizo copiar y pegar; tomaron problemas existentes, los tradujeron con extremo cuidado para asegurar que las palabras en bengalí se sintieran naturales y culturalmente correctas, y luego añadieron un enorme lote de nuevos desafíos complejos.

La verdadera magia de PatiGonit22K es su mezcla de niveles de dificultad. El conjunto de datos se divide en dos grupos principales: 5,412 problemas "simples" que involucran solo una operación matemática (como solo sumar o solo restar), y unos asombrosos 17,029 problemas "complejos" que requieren malabarear múltiples operaciones a la vez (como sumar, luego multiplicar, luego dividir). Este equilibrio es crucial porque permite a los investigadores probar si una computadora puede manejar una tarea aritmética básica o si puede perderse cuando el problema se vuelve desordenado. Los investigadores verificaron cada uno de los problemas con un equipo de expertos bilingües para asegurarse de que las matemáticas fueran correctas y el lenguaje fuera claro, eliminando cualquier entrada confusa o duplicada.

¿Qué significa esto para el futuro? El artículo sugiere que, al proporcionar esta colección de problemas más grande y diversa, los investigadores finalmente pueden entrenar y probar modelos de inteligencia artificial para ver qué tan bien entienden realmente las matemáticas en bengalí. Estudios previos habían demostrado que los modelos podían resolver problemas sencillos en bengalí con alta precisión, pero este nuevo conjunto de datos amplía los límites para ver si pueden abordar los acertijos de múltiples pasos más difíciles que son comunes en la vida real. Los autores presentan este conjunto de datos como un nuevo y robusto estándar de referencia (benchmark), una regla estándar contra la cual se pueden medir futuros modelos de IA. No afirman haber resuelto el problema del razonamiento de la IA para siempre, pero han entregado a la comunidad científica unas ruedas de entrenamiento mucho mejores y una pista de obstáculos más dura para asegurar que la próxima generación de IA pueda realmente pensar a través de problemas matemáticos en bengalí, no solo adivinar la respuesta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →