← Últimos artículos
💻 computer science

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

Este artículo presenta Sci-Rho, un referente simbólico multilingüe y visualmente fundamentado que comprende 4.242 plantillas de problemas STEM ejecutables en cinco materias y siete idiomas, el cual revela brechas de robustez significativas en los modelos de lenguaje-visión de vanguardia cuando se evalúan frente a variaciones de caso de peor escenario en lugar de promedios estáticos.

Autores originales: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás evaluando la capacidad de un nuevo estudiante para resolver problemas científicos. En el pasado, los investigadores le entregaban al estudiante una hoja de trabajo única y estática con una sola imagen y una pregunta. Si el estudiante acertaba, aprobaba. Pero este artículo argumenta que eso es como evaluar a un conductor solo en una carretera recta y vacía. No te dice si puede manejar un bache repentino, un desvío o una condición climática diferente.

Los autores de este artículo, Sci-ρ, decidieron construir una prueba de conducción mucho más difícil y dinámica para los "estudiantes" de IA (específicamente, Modelos de Lenguaje-Visión o VLMs).

Aquí hay un desglose sencillo de lo que hicieron y lo que encontraron:

1. La prueba de "cambio de forma" (El conjunto de datos)

En lugar de entregar a la IA 606 preguntas de ciencia estáticas, los investigadores construyeron una fábrica digital.

  • El Plano: Crearon 606 "plantillas" de problemas en Matemáticas, Física, Química, Biología y Ciencias de la Computación. Piensa en ellos como planos maestros.
  • La Fábrica: Escribieron código de computadora (Python) que toma estos planos e imprime instantáneamente 10 versiones ligeramente diferentes de cada problema.
    • Ejemplo: Si un problema de matemáticas pide el área de un cuadrado, la fábrica podría imprimir una versión con un lado de 5, otra con 7, otra con un color diferente, o incluso con una forma diferente.
  • El Giro Multilingüe: No lo hicieron solo en inglés. Tradujeron las instrucciones a 7 idiomas (incluyendo suajili, hindi y árabe), manteniendo las imágenes iguales.
  • El Resultado: Terminaron con 42,420 problemas únicos. Es como darle a la IA una biblioteca masiva donde cada libro tiene 10 ediciones diferentes, todas preguntando la misma lógica central pero luciendo ligeramente distintas.

2. La trampa del "Promedio" vs. "Peor Caso"

Los investigadores probaron 17 modelos de IA diferentes en esta enorme biblioteca. Observaron dos puntuaciones:

  • Precisión Promedio: Qué tan seguido la IA acierta la respuesta en todas las 10 versiones de un problema.
  • Precisión del Peor Caso: Qué tan seguido la IA acierta todas y cada una de las 10 versiones de un problema.

El Gran Descubrimiento:
Los modelos de IA se veían geniales en la puntuación de "Promedio". Pero cuando los investigadores observaron la puntuación del "Peor Caso", los modelos se desmoronaron.

  • La Analogía: Imagina a un estudiante que resuelve 9 de cada 10 problemas de matemáticas correctamente. Parece inteligente. Pero si le pides que resuelva las mismas 10 problemas nuevamente con números ligeramente diferentes, y esta vez falla en 4 de ellos, no está realmente "razonando" a través de las matemáticas. Probablemente solo está memorizando patrones o adivinando basándose en cómo se ven los números.
  • El Hallazgo: Incluso los modelos de IA más inteligentes y costosos (como GPT-5.4) mostraron una brecha enorme. Podían resolver un problema fácilmente, pero si cambiabas el color de un gráfico o los números ligeramente, a menudo fallaban. Los modelos más pequeños y baratos fallaban aún más estrepitosamente.

3. La Barrera del Idioma

Los investigadores comprobaron si la IA tenía más dificultades cuando las instrucciones estaban en un idioma distinto al inglés.

  • Los Grandes Modelos: Los modelos gigantes y costosos eran como políglotas; manejaron el inglés, el chino y el suajili casi con la misma eficacia.
  • Los Modelos Pequeños: Los modelos más pequeños y de código abierto eran como turistas que solo hablan inglés. Cuando las instrucciones cambiaban a un idioma menos común (como el suajili), su rendimiento caía significamente. Parecían confundirse solo por el cambio de idioma, a pesar de que el problema científico era el mismo.

4. El Problema de "Ojos vs. Cerebro"

Los investigadores echaron un vistazo al interior de uno de los modelos de IA para ver cómo "pensaba". Midieron cuánta atención prestaba el modelo a la imagen frente al texto.

  • El Hallazgo: La atención del modelo cambiaba dependiendo del idioma.
    • Cuando el texto estaba en chino, el modelo dependía menos de la imagen y más del texto.
    • Cuando el texto estaba en kazajo o hindi, el modelo dependía fuertemente de la imagen.
  • La Metáfora: Es como si la IA pensara: "No entiendo bien este idioma, así que adivinaré basándome en el dibujo". Cuando entiende el idioma perfectamente, confía más en las palabras. Esto sugiere que la IA no está "viendo" la imagen de una manera humana; simplemente está usando la imagen como una muleta cuando el texto es confuso.

5. Dónde se Atascó la IA

Cuando la IA fallaba, los investigadores categorizaron los errores:

  1. Leer mal la Imagen (63%): La IA no podía contar los puntos en un diagrama o leer los números en un gráfico correctamente.
  2. Mala Lógica (29%): La IA conocía la fórmula correcta pero la aplicaba a algo incorrecto, o inventaba hechos que no estaban allí.
  3. Errores Matemáticos (8%): La IA tenía la lógica correcta pero fallaba en la aritmética simple.

La Conclusión Final

El artículo concluye que las pruebas estáticas nos están mintiendo. El hecho de que una IA pueda resolver un problema científico específico una vez no significa que comprenda la ciencia. Podría simplemente estar reconociendo un patrón que vio durante su entrenamiento.

Para saber realmente si una IA es inteligente, necesitamos sacudir la mesa, cambiar los números, intercambiar los idiomas y ver si aún puede resolver el problema. Si no puede, no está razonando; solo está adivinando. Sci-ρ es la herramienta diseñada para sacudir esa mesa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →