← Últimos artículos
💻 computer science

Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models

El artículo presenta CES, un marco de evaluación que mide la coherencia y consistencia del razonamiento de ejecución de código en modelos de lenguaje grandes, revelando que, aunque algunos logran simulaciones coherentes, su rendimiento es a menudo inconsistente y depende en exceso de atajos lingüísticos en lugar de un análisis real del flujo de control y datos.

Autores originales: Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

Publicado 2026-04-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de estudiantes muy inteligentes (los Modelos de Lenguaje o LLMs) a los que les pides que resuelvan problemas de programación. Hasta ahora, los profesores solo les preguntaban: "¿Cuál es la respuesta final?". Si el estudiante acertaba el resultado, se le daba un aprobado, aunque no supiera explicar cómo llegó allí.

Este paper, titulado "Evaluando la Coherencia y Consistencia del Razonamiento de Ejecución de Código por Grandes Modelos de Lenguaje", presenta una nueva forma de examinar a estos estudiantes. Llama a su método CES (Simulación de Ejecución de Código).

Aquí te explico cómo funciona CES usando analogías sencillas:

1. El Problema: El Estudiante que "Adivina" la Respuesta

Imagina que le pides a un estudiante que resuelva un acertijo matemático complejo.

  • El método antiguo: Solo mirabas la respuesta final. Si decía "42", lo aprobabas.
  • El problema: A veces, el estudiante no hizo los cálculos. Quizás vio la respuesta en un libro de texto antiguo (datos contaminados), o simplemente adivinó por suerte (alucinación), o usó un atajo mental (como decir "si el problema habla de manzanas, la respuesta debe ser un número par").

El paper dice que muchos de los "éxitos" de la Inteligencia Artificial en programación son de este tipo: parecen correctos, pero el razonamiento interno es un desastre.

2. La Solución: CES (El Inspector de la Cocina)

CES no solo pregunta por el plato final (la salida del programa), sino que actúa como un inspector de cocina que vigila cada paso del proceso de cocción.

  • Simulación de Ejecución: En lugar de solo pedir el resultado, CES le pide al modelo: "Dime qué pasa con cada ingrediente en cada paso". ¿Qué valor tiene la variable x después del primer bucle? ¿Qué decisión tomó el programa en la línea 5?
  • Coherencia (La Lógica del Chef): Aquí está la magia. CES verifica si la historia que cuenta el modelo tiene sentido.
    • Ejemplo de incoherencia: El modelo dice: "Primero mezclé harina y agua (correcto), luego añadí sal (correcto), pero de repente el pastel salió horneado y dorado (incorrecto, porque no lo metió al horno)".
    • Si el modelo predice el resultado final correcto, pero sus pasos intermedios son una locura (como decir que el pastel se horneó sin horno), CES lo marca como "Incoherente" y descarta esa respuesta. Es como decir: "No te apruebo porque, aunque acertaste el resultado, tu lógica es falsa".

3. La Consistencia (El Estudiante Fiable vs. El Afortunado)

CES también mira si el estudiante es consistente en diferentes exámenes.

  • Consistencia Fuerte: El estudiante resuelve el mismo tipo de problema correctamente, incluso si cambias un poco los ingredientes (datos de entrada). Esto significa que realmente entendió la receta.
  • Consistencia Débil o Aleatoria: El estudiante acierta hoy, pero mañana falla en un problema casi idéntico. Esto sugiere que no está "pensando" realmente, sino que está adivinando o recordando patrones sueltos.

El estudio encontró que, aunque los modelos avanzados (como GPT-4) parecen genios, su "consistencia" es a menudo aleatoria. Es como un jugador de ruleta que a veces gana, pero no sabe por qué.

4. Detectando Trampas (Atajos y Alucinaciones)

El paper descubrió algo muy interesante:

  • Los modelos más "inteligentes" (como GPT-4 o DeepSeek-R1) a veces fallan más en la coherencia. ¿Por qué? Porque son tan buenos hablando que usan atajos de lenguaje natural.
    • Analogía: Si ves un problema que dice "XOR", el modelo puede pensar: "¡Ah! XOR significa 'o exclusivo', así que la respuesta es 010010". Lo dice con tanta seguridad que parece correcto, pero si miras el código paso a paso, el modelo no entendió cómo funciona el bucle interno. Simplemente adivinó basándose en el nombre de la función.

5. ¿Por qué importa esto? (El Diagnóstico de Bugs)

El paper también prueba si estos modelos pueden encontrar y arreglar errores en el código (bugs).

  • Descubrieron que cuando un modelo "arregla" un bug, a menudo no está analizando el código realmente. Está adivinando basándose en lo que suele pasar.
  • CES actúa como un detector de mentiras. Si un modelo dice "Arreglé el error" pero su simulación de cómo funciona el código es incoherente, sabemos que su éxito fue suerte o un truco, no inteligencia real.

En Resumen

Este paper nos dice: "Dejen de solo mirar la nota final".

Los modelos de IA actuales son como actores muy talentosos que pueden recitar el final de una obra de teatro perfectamente, pero a menudo olvidan la trama, los personajes y las motivaciones de la historia intermedia. CES es la herramienta que nos obliga a ver el guion completo para asegurarnos de que la IA realmente entiende lo que hace, y no solo está improvisando o recordando respuestas de memoria.

Es un paso crucial para confiar en la IA, especialmente en tareas críticas donde un error de lógica (aunque la respuesta final parezca correcta) puede causar desastres.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →