← Últimos artículos
🤖 AI

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

Este artículo presenta FindStatBench, un riguroso benchmark basado en ejecución para evaluar modelos de lenguaje de gran tamaño en la síntesis de código combinatorio, revelando que, si bien los mejores modelos convergen en rendimiento, su precisión se ve significativamente obstaculizada por los prompts largos, el impacto negativo contraintuitivo de los ejemplos en ciertas tareas y la dificultad inherente de la síntesis de mapas en comparación con la síntesis de estadísticas.

Autores originales: Soham Dan

Publicado 2026-07-22
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Soham Dan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot cómo ser un matemático. No quieres que simplemente charle sobre números; quieres que escriba el código real que resuelva un rompecabezas. Este es el mundo de la síntesis de código combinatorio. Piensa en la "combinatoria" como el estudio de cómo las cosas pueden ser dispuestas, mezcladas o contadas—como calcular de cuántas maneras puedes apilar bloques, organizar una baraja de cartas o colorear un mapa sin que dos colores iguales se toquen. La "síntesis de código" es simplemente el acto de que una IA escriba un programa informático para hacer las matemáticas.

Durante mucho tiempo, hemos probado a la IA en tareas de programación generales, como "escribe una función para ordenar una lista de nombres" o "corrige este error en un sitio web". Pero esas pruebas son un poco como pedirle a un chef que pique cebollas; muestran si el chef sabe cómo sostener un cuchillo, pero no si puede inventar una nueva receta desde cero. Este artículo hace una pregunta más difícil: Si le das a una IA una regla matemática estricta y abstracta y unos pocos ejemplos, ¿puede escribir un programa perfecto que siga esa regla para cualquier entrada posible, incluso aquellas que nunca ha visto antes? Es la diferencia entre un robot que puede seguir una receta y un robot que puede entender la química de la cocina lo suficientemente bien como para inventar un plato que nunca ha existido.


El Gran Desafío del Código Matemático: FindStatBench

Entra FindStatBench, un nuevo y superdifícil gimnasio para modelos de IA. Creado por investigadores de Scale AI, este benchmark está diseñado para poner a prueba al límite a los modelos de Lenguaje Extenso (LLM) en su capacidad de convertir descripciones matemáticas puras en código Python funcional. En lugar de pedirle a la IA que escriba un script simple, los investigadores le dieron 2,329 acertijos matemáticos distintos. Estos acertijos provienen de una base de datos del mundo real llamada FindStat, que es como una biblioteca de "recetas matemáticas" para cosas como permutaciones (mezclar listas), grafos (redes de puntos y líneas) y particiones (dividir números en sumas).

Las reglas del juego eran estrictas y de "libro cerrado". La IA recibía una descripción de un problema matemático y hasta cinco ejemplos de entradas y salidas. Tenía que escribir una única función de Python llamada solve(obj) que pudiera manejar cualquier objeto, no solo los ejemplos que vio. La IA no podía usar una calculadora, buscar en internet o pedir ayuda. Tenía que hacerlo bien al primer intento. Para asegurar que la IA no estuviera simplemente memorizando las respuestas, los investigadores probaron el código contra 5.52 millones de casos de prueba ocultos—millones de problemas matemáticos que la IA nunca había visto antes. Si el código fallaba incluso en uno de estos casos ocultos, se marcaba como incorrecto.

Los Resultados: Un Empate Sorprendente y Algunos Fallos Extraños

Cuando el polvo se asentó, los resultados fueron fascinantes y un poco contraintuitivos.

1. Los modelos "Grandes" y "Pequeños" están cabeza a cabeza
Podrías esperar que los modelos "cerrados" más caros y potentes (aquellos por los que tienes que pagar a grandes empresas para usar) aplasten a los modelos de "código abierto" (aquellos que cualquiera puede descargar y ejecutar). Pero en esta arena con tanta carga matemática, no fue así. El mejor modelo de código abierto, gpt-oss-120b, obtuvo una puntuación casi idéntica a la del mejor modelo de código cerrado, Claude Sonnet 4.6. Estaban separados por menos de 1 punto porcentual. Es como dos corredores en un maratón: uno tiene el patrocinio de una gran corporación con un equipo elegante, y el otro es un héroe local con un zapato hecho en casa. Cruzaron la línea de meta exactamente al mismo tiempo.

Aún más sorprendente, si tomabas las mejores respuestas de todos los once modelos probados y las combinabas, solo mejorabas la puntuación total en aproximadamente un 10%. Esto sugiere que todos estos modelos están chocando con un "techo" de capacidad similar. Todos están luchando con las mismas partes difíciles del rompecabezas.

2. Más ejemplos pueden, de hecho, empeorar las cosas
Aquí es donde se pone raro. En la mayoría de las pruebas de IA, dar más ejemplos ayuda al modelo a aprender. Pero en FindStatBench, para ciertos tipos de acertijos matemáticos llamados "bijecciones" (que son formas elegantes de decir "reglas de emparejamiento perfecto"), darle al modelo cinco ejemplos en realidad hizo que su rendimiento fuera peor que si le hubieran dado cero ejemplos.

Imagina que le estás enseñando a un estudiante a doblar una grulla de origami. Si solo dices "dobla el papel de esta manera", es posible que recuerde el pliegue clásico y perfecto. Pero si le muestras cinco ejemplos donde alguien hizo un pliegue ligeramente desordenado, el estudiante podría confundirse e intentar copiar los pliegues desordenados, olvidando la regla perfecta. El artículo encontró que, para algunas reglas matemáticas clásicas, los ejemplos "desplazaron" el conocimiento interno de la IA, causando que escribiera código roto que fallaba incluso ante los ejemplos que se le mostraron. Es un caso de "demasiada información, muy poco entendimiento".

3. La trampa del "Pensamiento"
Otro hallazgo importante fue que algunos modelos, especialmente aquellos diseñados para "pensar" antes de hablar, a menudo se quedaban sin espacio. Estos modelos tienen un límite en la cantidad de texto que pueden generar. A veces, gastaban todo su "presupuesto" escribiendo su razonamiento interno (su proceso de pensamiento) y nunca llegaban a escribir el código real. Es como un estudiante que pasa todo el tiempo del examen escribiendo un diario sobre lo difícil que es el examen, y luego se queda sin tiempo para resolver realmente los problemas. Los investigadores encontraron que simplemente dar a estos modelos más espacio para escribir sus pensamientos (y el código) solucionaba muchos de estos fallos.

4. Lo difícil sigue siendo difícil
Aunque la IA se volvió bastante buena en algunas tareas (como contar cosas o trabajar con formas simples), falló por completo en otras. Para tareas que involucran "particiones de conjuntos" (agrupar elementos de todas las formas posibles) y "árboles binarios" (estructuras jerárquicas), la precisión fue cercana a cero para todos los modelos, ya fueran de código abierto o de código cerrado. Parece que, sin importar qué tan grande sea el modelo, o cuánto cueste, estos tipos específicos de acertijos estructurales están actualmente fuera de su alcance.

Lo que esto significa

El artículo concluye que, si bien la IA se está volviendo muy buena escribiendo código matemático "plausible", sigue siendo frágil cuando se trata de reglas simbólicas exactas. Los modelos pueden adivinar la respuesta correcta a menudo, pero luchan por derivar consistentemente la lógica perfecta para estructuras complejas.

¿La principal conclusión? El costo no siempre equivale a la capacidad. En esta prueba específica, un modelo de código abierto más barato funcionó tan bien como los más caros y propietarios. Y a veces, darle a una IA más ejemplos o más "tiempo de pensamiento" no ayuda; de hecho, puede confundirla. Los investigadores sugieren que para dominar verdaderamente las matemáticas, la IA necesita mejorar en la comprensión de las reglas del juego, no solo en la memorización de los movimientos. Por ahora, la IA es un aprendiz talentoso que puede seguir instrucciones bien, pero todavía se pierde cuando se le pide que invente un nuevo tipo de geometría.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →