← Últimos artículos
🤖 AI

Function-Level Execution Feedback for Code Preference Optimization

El artículo presenta STEP-KTODER, un marco para la optimización de la preferencia de código que define los pasos como funciones a nivel de módulo con etiquetas de corrección binarias provenientes de pruebas unitarias, demostrando que este proceso de supervisión basado en la ejecución supera significativamente a los métodos basados únicamente en el resultado, evitando al mismo tiempo la corrupción de etiquetas causada por las anotaciones de LLM como juez.

Autores originales: Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

Publicado 2026-08-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe una brecha creciente entre los modelos que simplemente pueden producir una respuesta y aquellos que comprenden el trayecto para llegar a ella. Durante años, los investigadores han entrenado programas informáticos para resolver problemas matemáticos recompensándolos no solo por el número final, sino por cada paso lógico que dan en el camino. Este enfoque, conocido como supervisión de proceso, ha ayudado a las máquinas a razonar mucho mejor. Sin embargo, cuando se trata de escribir código de computadora, este método ha permanecido esquivo. A diferencia de un problema matemático, que se descompone naturalmente en una secuencia de cálculos, una pieza de software es a menudo una red enmarañada de instrucciones donde es difícil decir exactamente qué línea está bien y cuál está mal. Si un programa no se ejecuta, los métodos de entrenamiento tradicionales suelen tratar toda la salida como un fallo, incluso si el noventa por ciento del código es perfecto. Esta retroalimentación tosca deja a la máquina adivinando qué parte específica de su trabajo necesita ser corregida.

Un equipo de investigadores de la Universidad Nacional de Seúl y la Universidad de Konkuk ha desarrollado una nueva forma de enseñar a estos modelos a escribir mejor código, descomponiendo el problema en piezas manejables y comprobables. Llaman a su método STEP-KTODER. En lugar de juzgar un programa completo como una sola unidad, enseñan al modelo a ver un programa como una colección de funciones independientes, o pequeñas herramientas autónomas que realizan un trabajo específico. Los investigadores toman una solución correcta y la descomponen en estas funciones separadas. Luego, generan automáticamente un conjunto de comprobaciones simples, similares a un inspector de control de calidad que prueba una sola pieza de una máquina, para ver si cada función funciona correctamente por sí sola. Esto les permite dar al modelo una retroalimentación precisa: "Esta función específica es correcta, pero esa otra está rota", en lugar de simplemente decir "Todo el conjunto falló".

Los investigadores probaron este enfoque en varios desafíos estándar utilizados para medir qué tan bien puede la inteligencia artificial escribir código. Descubrieron que, al utilizar estas comprobaciones de ejecución de grano fino, sus modelos mejoraron significamente más que los modelos entrenados con métodos antiguos que solo miraban el resultado final. De hecho, en los desafíos de codificación más difíciles, su nuevo método aumentó el rendimiento en casi un veintisiete por ciento en comparación con las mejores técnicas anteriores. El estudio también reveló una visión crítica sobre cómo evaluamos el código: simplemente pedirle a un modelo de lenguaje potente que adivine si una pieza de código es correcta no es suficiente. Cuando los investigadores intentaron reemplazar sus comprobaciones automáticas basadas en la ejecución con juicios de otra IA, los resultados empeoraron. La IA de juicio tendía a ser excesivamente crítica, marcando incorrectamente código correcto como roto, lo que confundió el proceso de entrenamiento. Esto demostró que la única forma fiable de enseñar a un modelo el valor de un paso correcto es ejecutar realmente el código y ver si funciona.

El núcleo de este descubrimiento reside en cómo los investigadores manejaron la realidad desordenada de la programación, donde un programa podría pasar todas sus pruebas finales incluso si una de sus partes internas es defectuosa. En el pasado, tales contradicciones a menudo se ignoraban o se suavizaban. Sin embargo, el equipo encontró que estos conflictos son en realidad valiosos. Al preservar los casos donde el programa completo funciona pero una función específica falla, proporcionaron al modelo una lección matizada: un programa puede tener éxito en general mientras contiene errores que necesitan ser corregidos. Este enfoque permite al modelo aprender a reforzar las partes de su código que están funcionando bien mientras apunta específicamente a las partes que no lo están, de forma muy similar a un mecánico que sabe exactamente qué perno apretar en lugar de simplemente reemplazar todo el motor.

Este trabajo sugiere un camino práctico hacia el hacer la inteligencia artificial más fiable en tareas complejas. Al alejarse de juzgar el producto final de forma aislada y centrarse en la corrección de los componentes individuales que lo conforman, los investigadores pueden guiar a estos sistemas para que aprendan de manera más efectiva. El estudio demuestra que, para la generación de código, la supervisión más eficaz proviene de la ejecución y prueba del propio código, en lugar de una segunda opinión. Este cambio de la retroalimentación basada en el resultado a la retroalimentación basada en el proceso, fundamentada en la ejecución real, ofrece una forma más clara y directa para que las máquinas aprendan el oficio de la programación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →