How Robustly do LLMs Understand Execution Semantics?
El estudio revela que, aunque los modelos de razonamiento de código de código abierto mantienen un rendimiento estable ante perturbaciones, los modelos de vanguardia como GPT-5.2 muestran una fragilidad significativa al enfrentar cambios en el código o excepciones, lo que demuestra limitaciones en su comprensión semántica real y subraya la necesidad de evaluarlos mediante pruebas de robustez.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que las Inteligencias Artificiales (IA) que escriben código son como chefs de cocina extremadamente talentosos. Han leído millones de recetas (código) y pueden cocinar platos deliciosos (programas) si les das las instrucciones exactas que han visto antes.
Pero, ¿realmente entienden cómo funciona la cocina, o simplemente están memorizando qué ingredientes van juntos?
Este estudio, realizado por investigadores de la UC Davis y el University College London, decidió poner a prueba a estos "chefs de IA" no solo pidiéndoles que cocinen, sino que predigan qué pasará si cambiamos ligeramente la receta o los ingredientes.
Aquí tienes los hallazgos principales explicados con analogías sencillas:
1. La Prueba de la "Receta Perfecta" vs. "La Realidad"
Los investigadores usaron un examen estándar llamado CruxEval.
- El escenario: Le dan a la IA una receta y le preguntan: "¿Qué plato saldrá si uso estos ingredientes?".
- El resultado inicial: Las IAs más avanzadas (como GPT-5.2) acertaron casi el 99% de las veces. Parecían genios absolutos.
2. La Prueba de la "Tormenta de Ingredientes" (Perturbación de Entrada)
Luego, los investigadores hicieron algo astuto: cambiaron ligeramente los ingredientes.
- La analogía: Imagina que la receta pedía "3 huevos", pero tú le das a la IA "3 huevos y medio" o "3 huevos rotos". O que le pides que cocine con un ingrediente que no existe.
- Lo que pasó:
- Los modelos "abiertos" (Open Source): Se mantuvieron bastante estables. Si la receta original era un 60% de acierto, con ingredientes extraños seguían acertando un 60%. No eran perfectos, pero eran consistentes.
- El "Chef Estrella" (GPT-5.2): Aquí ocurrió algo sorprendente. Aunque era casi perfecto en la receta original, cuando le dieron ingredientes extraños, su rendimiento se desplomó hasta un 20-24% menos.
- La lección: El "Chef Estrella" no entendía la lógica de la cocina; solo había memorizado la receta exacta. Si cambiabas un detalle, se confundía por completo. Es como un actor que sabe su papel de memoria, pero si el guion cambia una sola palabra, se queda en blanco.
3. La Prueba de "Reescribir la Historia" (Transformación del Código)
Luego, cambiaron la forma de escribir la receta, pero sin cambiar su significado.
- La analogía: Es como decir "Pon la sal antes del agua" en lugar de "Pon el agua antes de la sal" (si el resultado es el mismo). O cambiar el nombre de los ingredientes de "harina" a "polvo blanco".
- Lo que pasó:
- La mayoría de las IAs entendieron que era la misma receta y funcionaron bien.
- GPT-5.2 volvió a fallar estrepitosamente. Cambiar el nombre de una variable (como llamar a una variable
xen lugar denumero) hizo que el modelo perdiera la pista. Esto sugiere que el modelo se fija demasiado en la "forma" de las palabras y no en el "significado" profundo.
4. El Problema de los "Desastres en la Cocina" (Excepciones)
A veces, al cambiar los ingredientes, la cocina explota (el programa da error).
- El desafío: La IA debe decirte: "¡Oye, si usas 3 huevos rotos, la sartén se romperá!".
- El resultado: Las IAs eran muy malas prediciendo estos desastres. A menudo, en lugar de decirte que algo va mal, intentaban adivinar un resultado positivo (como si el chef dijera "¡Saldrá delicioso!" aunque la sartén esté rota).
- La solución: Cuando los investigadores le dijeron explícitamente a la IA: "Por favor, revisa si algo va mal y dime qué error ocurre", el rendimiento mejoró drásticamente. Pero esto reveló otra cosa: la IA a veces inventaba errores solo para complacerte (un comportamiento llamado "sycophancy" o adulación).
5. El Laberinto de Decisiones
Finalmente, midieron qué tan bien funcionaban las IAs cuando el código tenía muchas decisiones (bucles, "si esto pasa, haz aquello, si no, haz lo otro").
- La analogía: Imagina un laberinto. Cuantas más encrucijadas (decisiones) haya, más difícil es para la IA encontrar la salida.
- El hallazgo: A medida que el código se volvía más complejo con más decisiones, la capacidad de la IA para predecir el resultado bajaba. Sin embargo, un modelo llamado Gemini 3 Pro fue una excepción notable: mantuvo su rendimiento incluso en laberintos complejos.
Conclusión: ¿Qué nos dice todo esto?
El estudio nos dice que, aunque las IAs actuales son muy buenas imitando lo que ya han visto, no siempre entienden la lógica profunda del código.
- GPT-5.2 es como un estudiante que memorizó el libro de texto palabra por palabra. Si le cambias una palabra en el examen, reprueba.
- Gemini 3 Pro y algunos modelos de código abierto parecen tener una comprensión más flexible, como un chef que sabe por qué se mezclan los ingredientes, no solo cuándo hacerlo.
En resumen: No debemos confiar ciegamente en estas IAs para arreglar o mantener código complejo sin supervisión humana, porque si el código cambia un poco (algo muy común en el mundo real), podrían fallar estrepitosamente. La "robustez" (la capacidad de aguantar cambios) es el verdadero problema que aún no han resuelto.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.