← Últimos artículos
🤖 AI

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

Este artículo propone entrenar modelos críticos pequeños con ajuste fino supervisado para proporcionar una dirección intra-trayectoria para agentes de código grandes, demostrando que este enfoque mejora significativamente el rendimiento en evaluaciones como SWE-bench Verified al tiempo que reduce tanto los costos computacionales como las longitudes de las trayectorias en comparación con el entrenamiento de extremo a extremo o la puntuación post-hoc.

Autores originales: Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

Publicado 2026-06-23
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El GPS vs. El Conductor

Imagina que estás intentando conducir un coche desde Nueva York hasta Los Ángeles. Tienes un conductor muy hábil (el Agente de Código) que sabe cómo girar el volante, presionar el acelerador y cambiar de marcha perfectamente. Sin embargo, este conductor a veces se confunde con la visión general. Podría dar vueltas en círculos, tomar un giro equivocado por leer mal una señal, o seguir intentando atravesar una pared porque piensa que es una puerta.

Normalmente, para solucionar esto, la gente intenta reentrenar al conductor desde cero. Pero eso es caro, lleva mucho tiempo y el conductor podría seguir quedándose atrapado en los mismos caminos confusos.

Este artículo propone una solución diferente: En lugar de reentrenar al conductor, contratamos a un pequeño y listo navegador GPS (el Modelo Crítico).

  • El Conductor (Agente): Hace todo el trabajo real (escribir código, ejecutar comandos). Se mantiene exactamente igual; no cambiamos su cerebro.
  • El GPS (Crítico): No toca el volante. En su lugar, observa al conductor cada pocos minutos. Si el conductor empieza a dar vueltas en círculos o se dirige hacia un precipicio, el GPS dice: "¡Oye, estás dando vueltas! Estás intentando arreglar el archivo equivocado. Detente y replantea tu estrategia".

El artículo demuestra que contratar a este pequeño GPS es mucho más barato que contratar a un navegador humano súper inteligente, y ayuda al conductor a llegar al destino mucho más rápido y con mayor frecuencia.


El Problema: Por qué solo "Entrenar" no es suficiente

Los autores observaron que, cuando se entrenan grandes agentes de IA para resolver errores de software, se vuelven muy buenos en la mecánica (escribir código, usar herramientas). Pero a menudo fallan en la estrategia (figurar el plan adecuado).

Es como enseñar a un estudiante a escribir ensayos. Puedes enseñarle gramática y ortografía perfectas (la mecánica), pero si no sabe organizar sus pensamientos o mantenerse en el tema (la estrategia), el ensayo seguirá siendo un desastre.

Cuando intentas entrenar a la IA para hacer ambas cosas a la vez, alcanza un "techo". Se queda estancada. Los autores descubrieron que aproximadamente el 65% de los fallos no se debían a que la IA escribiera mal el código, sino a que tenía un razonamiento defectuoso.

La Solución: Un "Pequeño Crítico"

El equipo construyó un sistema donde un modelo de IA pequeño (el Crítico) se sienta junto al gran agente de codificación.

  1. La Configuración: El gran agente intenta resolver un problema. Cada 5 o 10 pasos, hace una pausa.
  2. La Verificación: El pequeño Crítico observa lo que el agente ha hecho hasta el momento.
  3. El Consejo: El Crítico da un consejo corto y de alto nivel.
    • Mal consejo: "Borra la línea 42 y escribe un bucle aquí". (Esto es "conducir desde el asiento del copiloto" y el artículo dice que esto es malo porque el modelo pequeño no es lo suficientemente inteligente como para saber más de código que el grande).
    • Buen consejo: "Estás repitiendo el mismo comando tres veces. Estás atrapado en un bucle. Intenta un enfoque diferente". (Esto es "guiar" o "dirigir").
  4. La Reanudación: El gran agente lee el consejo y continúa trabajando.

Cómo Entrenaron al GPS

Para enseñar al pequeño Crítico cómo dar buenos consejos, no se limitaron a adivinar. Utilizaron a un "Profesor" (una IA masiva y muy costosa llamada Claude-Opus-4.6) para generar primero los consejos.

  • El Profesor: La IA costosa observaba al agente trabajar y escribía los consejos perfectos y de alto nivel.
  • El Estudiante: El pequeño y barato modelo de IA (Qwen3-8B) estudiaba estas notas. Aprendió a imitar el estilo del consejo (centrándose en la estrategia, no en líneas de código específicas) sin necesidad de ser tan inteligente como el Profesor.

Descubrimiento Crucial: El artículo encontró que el tipo de consejo es lo que más importa.

  • Si el Profesor daba instrucciones de código específicas, el pequeño estudiante no podía aprenderlo bien.
  • Si el Profesor daba estrategia de alto nivel (por ejemplo, "Estás estancado", "Verifica tus suposiciones"), el pequeño estudiante lo aprendió perfectamente.

Los Resultados: Más Rápido, Más Barato y Más Inteligente

El equipo probó esto en un benchmark famoso llamado SWE-bench, que es como un test de 500 errores de software del mundo real.

  1. Funciona con diferentes conductores: Entrenaron al Crítico usando un tipo de agente de codificación (CWM-32B). Luego, usaron ese mismo Crítico para ayudar a dos agentes de codificación diferentes (modelos Qwen) que nunca había visto antes.
    • Resultado: Los nuevos agentes mejoraron significativamente al resolver errores simplemente escuchando al Crítico.
  2. Ahorra Dinero: El "Profesor" (Claude-Opus) es muy caro de ejecutar. El "Estudiante" (Qwen3-8B) es diminuto y barato.
    • Resultado: El sistema que utiliza el pequeño Crítico fue entre 30 y 92 veces más barato que usar el Profesor costoso.
  3. Realmente Ahorra Tiempo: En uno de los grandes agentes, el Crítico no solo hizo al agente más inteligente; hizo que el agente dejara de perder el tiempo. El agente terminó las tareas más rápido, lo que ahorró aún más dinero. De hecho, todo el sistema (Agente + Crítico) fue más barato que el Agente trabajando solo.

La "Receta Secreta"

El artículo destaca dos razones principales por las que esto funcionó:

  1. Separación de Funciones: El Agente se enfoca en hacer (codificar), y el Crítico se enfoca en pensar (estrategia). No pelean por quién está al mando.
  2. Sin Conducir desde el Copiloto: Al Crítico se le prohíbe estrictamente decir "Escribe esta línea de código específica". Solo dice "Vas por el camino equivocado". Esto evita que el modelo pequeño dé instrucciones específicas erróneas que confundan al modelo grande.

Resumen

Piensa en este artículo como un plano para construir un equipo en lugar de un superhéroe. En lugar de intentar crear una IA gigante y perfecta que lo haga todo (lo cual es difícil y caro), construyeron un sistema donde un pequeño coach especializado guía a un trabajador poderoso.

El coach no hace el trabajo, pero al dar los empujones adecuados de alto nivel, el trabajador resuelve problemas que no podría resolver solo, y el equipo completo termina el trabajo más rápido y por menos dinero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →