JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
Cet article introduit JIT-Agent, un modèle entraînable qui synthétise et fait évoluer automatiquement des harnais d'agents spécifiques à une tâche à la volée, augmentant considérablement les performances de divers modèles de fondation et établissant l'intelligence du harnais comme une dimension scalable et orthogonale de la capacité des agents.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : Mise à l'échelle de l'intelligence du harnais via l'évolution du harnais juste-à-temps
1. Énoncé du problème
La capacité d'un agent LLM n'est pas uniquement déterminée par les poids du modèle de fondation, mais est conjointement définie par le harnais de l'agent — l'échafaudage opérationnel comprenant la gestion de la mémoire, les stratégies de planification, les protocoles d'action et l'orchestration des outils/compétences. Si un modèle puissant peut échouer sous un harnais inapproprié, un harnais robuste ne peut débloquer le potentiel que si le modèle est capable de l'interpréter et de le suivre.
Les approches actuelles d'optimisation de harnais reposent principalement sur des méthodes Ahead-of-Time (AOT - Avant l'exécution). Ces systèmes traitent le harnais comme un artefact durable optimisé sur un flux d'expérience pour généraliser à travers de futures tâches. Cependant, les approches AOT se heurtent à la dépendance à l'instance : différentes tâches (par exemple, recherche large vs tâches terminales vs recherche approfondie) nécessitent des priors de harnais fondamentalement différents. Optimiser un harnais AOT unique à travers des demandes hétérogènes est laborieux, nécessitant des espaces de conception vastes et une accumulation de trajectoires, échouant souvent à correspondre à la structure spécifique d'un nouveau problème. Le papier pose que la conception de harnais doit passer d'une tâche d'ingénierie manuelle et statique à une capacité Just-in-Time (JIT - Juste-à-temps), où un méta-agent entraîné synthétise un harnais spécifique à la tâche à la volée.
2. Méthodologie : JIT-Agent
Les auteurs proposent JIT-Agent, un méta-agent compact conçu pour synthétiser, réparer et faire évoluer des harnais adaptatifs aux tâches pour des LLM agentiques standards.
2.1 Formalisation : Le protocole à quatre modules
Pour rendre la génération de harnais réalisable et structurée, le papier formalise le harnais de l'agent comme un artefact composable, générable par machine et régi par un protocole fixe à quatre modules :
- Mémoire () : Compresse l'historique en une vue () de l'historique réalisé.
- Planification () : Convertit la vue en une directive locale ().
- Orchestration des capacités () : Sélectionne et séquence les outils/compétences pertinents () basés sur la directive.
- Action () : Consomme le contexte assemblé pour mettre à jour l'état du contrôleur et émettre la prochaine action ().
Cette factorisation transforme des programmes hétérogènes en coordonnées comparables au sein d'un espace conforme au protocole (). Les auteurs introduisent HarnessFactory, un code source unifié implémentant 13 scaffolds contemporains représentatifs (ex: ReAct, Plan-and-Execute, agents récursifs) sous cette interface commune pour servir de banque de semences ().
2.2 Pipeline d'entraînement
JIT-Agent est entraîné via un pipeline en trois étapes pour atteindre une Intelligence de Harnais (adaptabilité, fiabilité et évolutivité) :
Étape I : Personnalisation conditionnée par la tâche
- Objectif : Apprendre au modèle à mapper une spécification de tâche et un petit contexte de référence vers un harnais conforme au protocole.
- Méthode : Un modèle enseignant plus fort et gelé synthétise des harnais adaptés à la tâche. Les données d'entraînement incluent à la fois le réglage fin supervisé (SFT) sur des générations valides et l'apprentissage de préférence. L'objectif de préférence () optimise les harnais qui améliorent la récompense de la tâche sans dégrader l'efficacité (latence ou coût), en utilisant une règle de préférence de type Pareto.
- Objectif : Apprendre au modèle à mapper une spécification de tâche et un petit contexte de référence vers un harnais conforme au protocole.
Étape II : Réparation de harnais
- Objectif : Assurer la fiabilité en apprenant à récupérer des échecs de synthèse.
- Méthode : Les générations échouées (erreurs de compilation, incompatibilités d'interface, exceptions d'exécution) sont converties en trajectoires de réparation bornées. Un enseignant propose des révisions structurées () pour corriger le harnais. Le modèle est entraîné à imiter ces transitions de réparation, apprenant à utiliser le feedback d'exécution pour restaurer une exécution conforme au protocole dans un horizon court (max 2 tours).
Étape III : Optimisation de politique par groupe découplé évolutif (Evo-GDPO)
- Objectif : Permettre une évolution en ligne où le modèle apprend à proposer des harnais qui surpassent la frontière de l'archive actuelle.
- Méthode : Pendant l'entraînement, le modèle propose un groupe de harnais candidats. Ceux-ci sont évalués par rapport à un incident (le meilleur harnais dans la banque actuelle pour cette tâche). Le signal de récompense est découpé en trois canaux :
- Récompense : Signal primaire ; les candidats doivent égaler ou dépasser la récompense de l'incident.
- Latence et Coût : Signaux d'efficacité activés uniquement si la récompense est préservée.
- La politique est mise à jour à l'aide d'un objectif de type PPO piloté par un avantage agrégé et normalisé qui récompense le dépassement de la frontière tout en maintenant l'efficacité. La banque de harnais () est mise à jour de manière conservatrice, ne conservant que les designs qui font progresser la frontière.
2.3 Architecture d'inférence
JIT-Agent supporte deux modes d'inférence :
- Inférence Statique : Génère harnais en parallèle, en sélectionne un, et l'exécute. Utile pour maximiser la diversité des candidats sans augmenter les rollouts de l'environnement.
- Inférence en Streaming : Conçue pour les flux de tâches. Le modèle récupère des références d'une banque évolutive, génère un harnais, l'exécute, et met à jour la banque basée sur le feedback. Cela permet de transférer l'expérience à travers les tâches sans mettre à jour les paramètres du modèle pendant le déploiement.
3. Résultats Clés
Le papier évalue JIT-Agent à travers neuf benchmarks couvrant la recherche approfondie, le travail quotidien, la planification et les tâches d'espace de travail, en utilisant des backbones incluant GLM-5.2, DeepSeek-V4-Flash, Qwen3.6 et Mimo-V2.5.
Gains de Performance : Remplacer les scaffolds par défaut par des harnais générés par JIT produit des améliorations constantes.
- GLM-5.2 : Amélioration moyenne de +7,7 points sur neuf benchmarks. Gains notables de +20,2 sur DeepPlanning-Travel et +4,3 sur OdysseyBench.
- DeepSeek-V4-Flash : Amélioration moyenne de +8,8 points. Il surpasse GPT-5.6 sur DeepSearchQA (+9,1).
- Généralisation : JIT-Agent améliore les performances de toutes les familles de modèles testées (DeepSeek, Qwen, Mimo) et variantes (Flash/Pro), indiquant que la capacité se transfère à travers les poids des modèles.
Compétitivité avec les harnais fixes :
- Les harnais générés par JIT sont compétitifs en performance avec des runtimes matures comme OpenCode et Claude Code.
- Sur DeepSeek-V4-Flash, JIT-Agent surpasse le plus fort harnais fixe (NanoBot) de +4,7 points sur DeepSearchQA et +4,0 points sur xBench-DS.
Efficacité des Coûts :
- JIT-Agent atteint la plus faible consommation de tokens et le coût d'API le plus bas dans tous les environnements contrôlés.
- Comparé au harnais fixe le moins cher, il réduit les coûts par cas de 14,9 à 54,1 % (moyenne de 36,0 %) tout en améliorant la performance. Par exemple, sur DeepSeek-V4-Flash xBench-DS, l'usage de tokens est passé de 527K à 212K tandis que la performance est passée de 78,0 à 82,0.
- L'analyse de la frontière de Pareto montre que JIT-Agent déplace les points de fonctionnement vers le haut et la gauche (performance plus élevée, coût plus bas), prouvant que les gains ne sont pas dus à des trajectoires plus longues mais à une meilleure orchestration.
Évolution au Temps de Test :
- Le JIT en Streaming (qui met à jour la banque de harnais sur un flux de tâches) surpasse systématiquement le JIT Statique (générations indépendantes) en précision cumulative, démontant la valeur de l'apprentissage à partir du feedback d'exécution.
4. Signification et Revendications
Le papier affirme établir l'Intelligence de Harnais comme une nouvelle dimension de la capacité des agents, entraînable et transférable, qui est orthogonale à l'échelle du modèle.
- Changement de Paradigme : Ce travail déplace l'ingénierie de harnais de l'approche "Ahead-of-Time" (optimiser un artefact statique) vers le "Just-in-Time" (synthétiser un échafaudage spécifique à la tâche à la volée).
- Modèle-en-tant-que-Harnais : Il démontre qu'un méta-agent entraîné peut générer des échafaudages opérationnels permettant à des backbones plus faibles ou plus efficaces de rivaliser ou de surpasser des modèles plus puissants avec des harnais fixes.
- Scalabilité : En formalisant le harnais comme un protocole composable et en entraînant un générateur pour le faire évoluer, le papier suggère une voie pour l'augmentation de la capacité des agents via l'optimisation de l'environnement d'exécution lui-même, plutôt que par le seul passage à l'échelle des paramètres du modèle.
- Direction Future : Les auteurs voient cela comme une étape vers la Co-Conception Modèle-Harnais, où les modèles de fondation pourraient éventuellement intérioriser la capacité de construire, réviser et faire évoluer leurs propres systèmes d'exécution.
Le papier conclut que l'intelligence du harnais n'est pas simplement un détail d'implémentation mais un déterminant de premier ordre de la performance des agents, capable de récupérer une capacité substantielle qui nécessiterait autrement un passage à l'échelle coûteux du backbone.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.