JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
Este artículo presenta JIT-Agent, un modelo entrenable que sintetiza y evoluciona automáticamente arneses de agentes específicos para tareas sobre la marcha, impulsando significativamente el rendimiento de varios modelos fundacionales y estableciendo la inteligencia del arnés como una dimensión escalable y ortogonal de la capacidad del agente.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Escalamiento de la Inteligencia del Harness mediante la Evolución del Harness Just-in-Time
1. Planteamiento del Problema
La capacidad de un agente de LLM no está determinada únicamente por los pesos del modelo fundacional, sino que está definida conjuntamente por el harness del agente (el andamiaje operativo que comprende la gestión de la memoria, las estrategias de planificación, los protocolos de acción y la orquestación de herramientas/habilidades). Si bien un modelo fuerte puede fallar bajo un harness inapropiado, un harness robusto solo puede desbloquear el potencial si el modelo es capaz de interpretarlo y seguirlo.
Los enfoques actuales para la optimización del harness dependen predominantemente de métodos Ahead-of-Time (AOT). Estos sistemas tratan al harness como un artefacto duradero optimizado sobre un flujo de experiencia para generalizar en tareas futuras. Sin embargo, los enfoques AOT tienen dificultades con la dependencia de la instancia: diferentes tareas (por ejemplo, búsqueda amplia frente a tareas terminales o investigación profunda) requieren priors de harness fundamentalmente distintos. Optimizar un único harness AOT a través de demandas heterogéneas es engorroso, requiere espacios de diseño extensos y acumulación de trayectorias, y a menudo falla en igualar la estructura específica de un nuevo problema. El artículo postula que el diseño del harness debe pasar de ser una tarea de ingeniería manual y estática a una capacidad Just-in-Time (JIT), donde un meta-agente entrenado sintetiza un harness específico para la tarea sobre la marcha.
2. Metodología: JIT-Agent
Los autores proponen JIT-Agent, un meta-agente compacto diseñado para sintetizar, reparar y evolucionar harnesses adaptables a la tarea para cualquier LLM agéntico convencional.
2.1 Formalización: El Protocolo de Cuatro Módulos
Para hacer que la generación del harness sea factible y estructurada, el artículo formaliza el harness del agente como un artefacto composable y generable por máquina gobernado por un protocolo fijo de cuatro módulos :
- Memoria (): Comprime el historial en una vista () del historial realizado.
- Planificación (): Convierte la vista en una directiva local ().
- Orquestación de Capacidades (): Selecciona y secuencia herramientas/habilidades relevantes () basadas en la directiva.
- Acción (): Consume el contexto ensamblado para actualizar el estado del controlador y emitir la siguiente acción ().
Esta factorización convierte programas heterogéneos en coordenadas comparables dentro de un espacio que cumple con el protocolo (). Los autores introducen HarnessFactory, un código base unificado que implementa 13 scaffolds contemporáneos representativos (por ejemplo, ReAct, Plan-and-Execute, agentes recursivos) bajo esta interfaz común para servir como un banco de semillas ().
2.1 Pipeline de Entrenamiento
JIT-Agent se entrena mediante un pipeline de tres etapas para lograr Inteligencia de Harness (adaptabilidad, fiabilidad y evolucionabilidad):
Etapa I: Personalización Condicionada a la Tarea
- Objetivo: Enseñar al modelo a mapear una especificación de tarea y un pequeño contexto de referencia a un harness que cumpla con el protocolo.
- Método: Un modelo profesor más fuerte y congelado sintetiza harnesses adaptados a la tarea. Los datos de entrenamiento incluyen tanto el ajuste fino supervisado (SFT) sobre generaciones válidas como el aprendizaje de preferencias. El objetivo de preferencia () optimiza los harnesses que mejoran la recompensa de la tarea sin degradar la eficiencia (latencia o costo), utilizando una regla de preferencia de tipo Pareto.
Etapa II: Reparación de Harnesses
- Objetivo: Garantizar la fiabilidad aprendiendo a recuperarse de los fallos de síntesis.
- Método: Las generaciones fallidas (errores de compilación, desajustes de interfaz, excepciones en tiempo de ejecución) se convierten en trayectorias de reparación acotadas. Un profesor propone revisiones estructuradas () para corregir el harness. El modelo es entrenado para imitar estas transiciones de reparación, aprendiendo a usar el feedback de ejecución para restaurar la ejecución válida del protocolo dentro de un horizonte corto (máximo 2 rondas).
Etapa III: Optimización de Política de Grupo Desacoplada Evolutiva (Evo-GDPO)
- Objetivo: Permitir la evolución online donde el modelo aprende a proponer harnesses que superen la frontera del archivo actual.
- Método: Durante el entrenamiento, el modelo propone un grupo de harnesses candidatos. Estos se evalúan contra un incumbente (el mejor harness en el banco actual para esa tarea). La señal de recompensa se desacopla en tres canales:
- Recompensa: Señal primaria; los candidatos deben igualar o exceder la recompensa del incumbente.
- Latencia y Costo: Señales de eficiencia que se activan solo si la recompensa se preserva.
- La política se actualiza utilizando un objetivo de tipo PPO impulsado por una ventaja agregada y normalizada que recompensa el superar la frontera mientras se mantiene la eficiencia. El banco de harnesses () se actualiza de forma conservadora, reteniendo solo los diseños que avanzan la frontera.
2.3 Arquitectura de Inferencia
JIT-Agent soporta dos modos de inferencia:
- Inferencia Estática: Genera harnesses en paralelo, selecciona uno y lo ejecuta. Útil para maximizar la diversidad de candidatos sin aumentar las ejecuciones en el entorno.
- Inferencia de Streaming: Diseñada para flujos de tareas. El modelo recupera referencias de un banco en evolución, genera un harness, lo ejecuta y actualiza el banco basado en el feedback. Esto permite que la experiencia se transfiera entre tareas sin actualizar los parámetros del modelo durante el despliegue.
3. Resultados Clave
El artículo evalúa JIT-Agent a través de nueve benchmarks que cubren investigación profunda, trabajo diario, planificación y tareas de espacio de trabajo, utilizando backbones que incluyen GLM-5.2, DeepSeek-V4-Flash, Qwen3.6 y Mimo-V2.5.
Ganancias de Rendimiento: Reemplazar los scaffolds por defecto con harnesses generados por JIT produce mejoras consistentes.
- GLM-5.2: Mejora promedio de +7.7 puntos en nueve benchmarks. Ganancias notables incluyen +20.2 en DeepPlanning-Travel y +4.3 en OdysseyBench.
- DeepSeek-V4-Flash: Mejora promedio de +8.8 puntos. Supera a GPT-5.6 en DeepSearchQA (+9.1).
- Generalización: JIT-Agent mejora el rendimiento en todas las familias de modelos probadas (DeepSeek, Qwen, Mimo) y variantes (Flash/Pro), indicando que la capacidad se transfiere a través de los pesos del modelo.
Competitividad con Harnesses Fijos:
- Los harnesses generados por JIT son competitivos en rendimiento con runtimes maduros como OpenCode y Claude Code.
- En DeepSeek-V4-Flash, JIT-Agent supera al más fuerte harness fijo (NanoBot) por +4.7 puntos en DeepSearchQA y +4.0 puntos en xBench-DS.
Eficiencia de Costos:
- JIT-Agent logra el menor consumo de tokens y costo de API en todos los entornos controlados.
- Comparado con el harness fijo más barato, reduce los costos por caso en un 14.9–54.1% (promedio 36.0%) mientras mejora el rendimiento. Por ejemplo, en DeepSeek-V4-Flash xBench-DS, el uso de tokens cayó de 527K a 212K mientras el rendimiento subió de 78.0 a 82.0.
- El análisis de la frontera de Pareto muestra que JIT-Agent desplaza los puntos operativos hacia la parte superior izquierda (mayor rendimiento, menor costo), probando que las ganancias no se deben a trayectorias más largas, sino a una mejor orquestación.
Evolución en Tiempo de Prueba:
- JIT de Streaming (que actualiza el banco de harnesses a lo largo de un flujo de tareas) supera consistentemente al JIT Estático (generaciones independientes) en precisión acumulada, demostando el valor de aprender del feedback de ejecución.
4. Significado y Reivindicaciones
El artículo afirma establecer la Inteligencia de Harness como una nueva dimensión de la capacidad del agente, la cual es entrenable y transferible, y es ortogonal al escalamiento del modelo.
- Cambio de Paradigma: El trabajo mueve la ingeniería de harness de "Ahead-of-Time" (optimizar un artefacto estático) a "Just-in-Time" (sintetizar un andamiaje específico para la tarea sobre la marcha).
- Modelo-como-Harness: Demuestra que un meta-agente entrenado puede generar scaffolds operativos que permiten a backbones más débiles o eficientes rivalizar o incluso superar a modelos más fuertes con harnesses fijos.
- Escalabilidad: Al formalizar el harness como un protocolo composable y entrenar a un generador para evolucionarlo, el artículo sugiere un camino para escalar la capacidad del agente mediante la optimización del entorno de ejecución mismo, no solo a través del escalamiento de parámetros del modelo.
- Dirección Futura: Los autores ven esto como un paso hacia el Co-Diseño Modelo-Harness, donde los modelos fundacionales podrían eventualmente internalizar la capacidad de construir, revisar y evolucionar sus propios sistemas de ejecución.
El artículo concluye que la inteligencia del harness no es simplemente un detalle de implementación, sino un determinante de primer orden del rendimiento del agente, capaz de recuperar una capacidad sustancial que de otro modo requeriría un costoso escalamiento del backbone.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.