← Últimos artículos
💻 computer science

Evaluating LLMs Code Reasoning Under Real-World Context

Este artículo presenta R2Eval, un nuevo conjunto de pruebas que evalúa la capacidad de razonamiento de código de los modelos de lenguaje grandes mediante problemas extraídos de proyectos reales de Python, superando las limitaciones de los benchmarks existentes al preservar la complejidad de los tipos de datos y las dependencias del mundo real.

Autores originales: Changshu Liu

Publicado 2026-04-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Changshu Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrenando a un chef de cocina (el modelo de IA) para que sea un experto en recetas.

Hasta ahora, los "exámenes" que le hacíamos a estos chefs eran muy simples. Le dábamos una tarjeta con una receta básica, como "mezcla harina y agua", y le preguntábamos: "¿Qué sale al final?" o "¿Qué ingredientes usaste?". El chef respondía bien porque las recetas eran cortas, usaban ingredientes básicos (como harina, que es como un número o una palabra simple) y no tenían trucos ocultos.

El problema: En la vida real, cocinar no es así. En un restaurante de verdad, los ingredientes son cosas complejas: un "pastel de cumpleaños" no es solo harina y agua, es una estructura con capas, decoraciones y sabores que dependen unos de otros. Si le preguntas a un chef cómo hacer un pastel complejo solo dándole una lista de ingredientes simples, se confunde.

¿Qué propone este paper? (R2Eval)

El autor, Changshu Liu, dice: "¡Oye, estamos probando a los chefs en una cocina de juguete, no en una real!". Por eso, crea R2Eval, que es como un examen de cocina en un restaurante de lujo real.

Aquí está la magia de cómo funciona, explicado con analogías:

  1. El problema de los "ingredientes invisibles":
    En el código de programas reales (como los que usa Google o Facebook), hay "objetos" complejos. Imagina que en lugar de decir "tengo una manzana", el código dice "tengo un ObjetoMágicoDeManzana". Si intentas leer esto en papel, solo ves un código de barras o una dirección de memoria (como "Manzana #4582 en el almacén"). No sabes qué sabor tiene ni cómo se ve.

    • La solución de R2Eval: El sistema actúa como un traductor mágico. Toma ese "ObjetoMágico" y lo desarma pieza por pieza hasta convertirlo en una lista de ingredientes simples y comprensibles (como un JSON, que es como una lista de la compra muy organizada). Así, el chef (la IA) puede ver realmente qué tiene en las manos.
  2. El examen real:
    En lugar de recetas de 3 líneas, R2Eval toma 135 problemas reales de programas famosos (como los que usa Django o Scikit-learn). Le da a la IA el código, la lista de ingredientes desarmada y le pide que adivine:

    • ¿Qué ingredientes se necesitaron para llegar a este resultado? (Predicción de entrada).
    • ¿Qué resultado se obtendrá con estos ingredientes? (Predicción de salida).

¿Qué pasó cuando pusieron a prueba a las IAs?

Los resultados fueron una sorpresa enorme, como si un campeón de ajedrez cayera en un tablero con reglas nuevas:

  • En los exámenes viejos (CRUXEval): Las IAs más inteligentes acertaban casi el 90% de las veces. Parecían genios.
  • En el examen real (R2Eval): Su rendimiento se desplomó.
    • Para adivinar ingredientes: bajaron un 64%.
    • Para adivinar resultados: bajaron un 52%.

¿Por qué? Porque en la vida real, las cosas dependen unas de otras de formas complicadas. En los exámenes viejos, todo estaba aislado. En la vida real, para entender una parte del código, tienes que entender cómo se conecta con otras partes, cómo usa herramientas de terceros y cómo maneja objetos extraños. Las IAs, aunque son muy listas, se pierden en este laberinto de dependencias.

La conclusión sencilla

Este paper nos dice: "No nos engañemos con los puntajes altos en exámenes fáciles".

Hasta ahora, pensábamos que las IAs entendían el código como humanos expertos. Pero este estudio demuestra que, cuando el código se vuelve complejo y real (como en el mundo real), las IAs todavía tienen dificultades para seguir el hilo. R2Eval es la nueva herramienta para asegurarnos de que, antes de confiarle a una IA una tarea importante, sepamos si realmente puede cocinar un "pastel complejo" o si solo sabe mezclar harina y agua.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →