← Últimos artículos
🤖 AI

COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

COMPAS es un marco de trabajo consciente de la dificultad que optimiza la generación de código mediante la búsqueda conjunta del mejor modelo, el mejor prompt y la mejor configuración de decodificación para grupos de dificultad de tareas específicos, logrando mejoras significativas tanto en las tasas de aprobación como en la eficiencia de costos en benchmarks como LiveCodeBench y SWE-bench.

Autores originales: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

Publicado 2026-08-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando hornear el pastel perfecto, pero tienes un horno mágico que puede hablarte. En el mundo de la informática, este "horno" es un Modelo de Lenguaje de Gran Tamaño (LLM, por sus siglas en inglés), una IA superinteligente que puede escribir código de computadora tal como lo hace un programador humano. Para obtener el mejor pastel, necesitas elegir tres cosas: qué horno usar (el modelo), qué receta darle (el prompt) y cómo ajustar la temperatura y el temporizador (los ajustes de decodificación). Durante mucho tiempo, los científicos intentaron encontrar una sola receta y ajuste de horno perfectos que funcionaran para cada pastel, desde un simple cupcake hasta un complejo pastel de bodas. Pero seguían encontrándose con un problema: un ajuste que hace que un cupcake sea esponjoso podría quemar un pastel de bodas, y un ajuste que ahorra dinero en harina podría arruinar el sabor. La gran pregunta era: ¿cómo encontramos la combinación perfecta para cada tarea específica sin gastar una fortuna o años intentando cada posibilidad?

Entra COMPAS, un nuevo método que actúa como un jefe de cocina brillante y consciente del presupuesto. En lugar de adivinar una regla para todos, COMPAS se da cuenta de que las diferentes tareas tienen diferentes "niveles de dificultad". Sugiere que debemos agrupar nuestras tareas —como clasificar problemas en "Fácil", "Medio" y "Difícil"— y luego encontrar una receta única y perfecta para cada grupo. Los investigadores descubrieron que los prompts (las instrucciones) y los ajustes de decodificación (los diales del horno) funcionan mejor cuando se ajustan juntos, no por separado, y que lo que funciona para un modelo de IA puede fallar para otro. Al utilizar un proceso inteligente de dos pasos —primero elegir el horno adecuado para el trabajo, luego ajustar la receta y los diales juntos— construyeron un "menú" de opciones para cada nivel de dificultad. Cuando llega una nueva tarea, COMPAS verifica instantáneamente su dificultad, elige el menú prefabricado perfecto para ese grupo y se pone a trabajar.

En sus experimentos, este enfoque fue un gran éxito. En un conjunto de pruebas de problemas de programación llamado LiveCodeBench, COMPAS logró la respuesta correcta el 52.8% de las veces, superando al mejor método anterior que solo alcanzó el 45.9%. Mejor aún, lo hizo gastando significativamente menos dinero: el costo cayó de $36.57 a solo $4.92. También lo probaron en un desafío más complejo que implica corregir errores en proyectos de software completos (SWE-bench), donde resolvió el 76.0% de las tareas, superando nuevamente a los mejores métodos existentes.

La salsa secreta de COMPAS es su estrategia "consciente de la dificultad". Los investigadores descubrieron tres cosas clave a través de sus experimentos. Primero, las instrucciones y los ajustes del horno interactúan; cambiar ambos juntos produce mejores resultados que cambiarlos uno por uno. Segundo, un ajuste que ayuda a un modelo de IA puede en realidad perjudicar a otro, por lo que hay que elegir el modelo cuidadosamente antes de empezar a ajustar. Segundo, y lo más importante, el "mejor" ajuste para un problema fácil es totalmente diferente del "mejor" para uno difícil. Un enfoque global de "talla única" simplemente no funciona.

Para resolver esto, COMPAS utiliza un plan de dos fases. En la fase offline (la etapa de preparación), divide todas las tareas de entrenamiento en grupos basados en qué tan difíciles son. Luego, ejecuta una prueba rápida y barata para elegir el mejor modelo de IA para cada grupo. Una vez elegido el modelo, entra en un modo de "búsqueda conjunta", donde utiliza un ciclo de retroalimentación inteligente para ajustar simultáneamente el prompt y los ajustes de decodificación. No solo prueba combinaciones al azar; aprende de sus errores y éxitos, construyendo un "frente de calidad-costo"—esencialmente, una lista de los mejores posibles compromisos entre obtener un buen resultado y ahorrar dinero—para cada grupo de dificultad.

En la fase online (la cocción en tiempo real), cuando llega una nueva tarea, COMPAS no pierde tiempo buscando. Simplemente mira la etiqueta de dificultad de la tarea, encuentra el grupo correspondiente y elige la configuración óptima de ese grupo. Es como tener una biblioteca de recetas perfectamente ajustadas listas para usar, para que nunca tengas que empezar desde cero.

El artículo muestra que este método es robusto. Incluso cuando cambiaron las semillas aleatorias (como barajar el mazo de cartas de manera diferente) o lo probaron con diferentes tipos de modelos de IA, COMPAS superó consistentemente a otros métodos. También demostró que desglosar las tareas por dificultad es crucial; si ignoras los niveles de dificultad e intentas usar un solo ajuste para todo, tus resultados caen significativamente. Aunque el método actualmente funciona mejor cuando los modelos de IA son de la misma "familia", los investigadores sugieren que este enfoque podría expandirse en el futuro. Por ahora, COMPAS es una demostración poderosa de que ser inteligente sobre cómo buscas los ajustes correctos es tan importante como los ajustes mismos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →