Learning Agent Routing From Early Experience
Ce papier présente BoundaryRouter, un cadre sans entraînement qui optimise le compromis entre latence et performance en acheminant dynamiquement les requêtes vers une inférence de LLM léger ou une exécution complète d'agent, en se basant sur une expérience comportementale précoce et un raisonnement guidé par des critères, réalisant ainsi des améliorations significatives en vitesse et en précision par rapport aux méthodes existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant très intelligent et rapide, mais parfois trop confiant (le LLM), et un consultant expert hautement qualifié, méticuleux, mais lent et coûteux (l'Agent).
- L'Assistant peut répondre instantanément et gratuitement à des questions simples comme « Quelle est la capitale de la France ? ». Mais si vous lui demandez de résoudre un problème de physique complexe ou d'écrire un code long et multi-étapes, il pourrait se tromper ou halluciner.
- L'Expert peut résoudre parfaitement ces problèmes difficiles en utilisant des outils, en faisant des recherches et en réfléchissant étape par étape. Mais cela prend beaucoup de temps et coûte très cher.
Le Problème :
Actuellement, si vous avez un mélange de questions faciles et difficiles, vous devez deviner à qui les envoyer. Si vous envoyez tout à l'Expert, vous gaspillez du temps et de l'argent sur des questions faciles. Si vous envoyez tout à l'Assistant, vous obtenez des réponses erronées sur les questions difficiles.
La Solution : "BoundaryRouter"
L'article présente un nouveau système appelé BoundaryRouter. Imaginez-le comme un agent de police intelligent se tenant à l'intersection entre l'Assistant et l'Expert. Sa tâche est d'examiner chaque question entrante et de décider : « Est-ce assez facile pour l'Assistant, ou cela nécessite-t-il l'Expert ? »
La partie délicate est que cet agent de police doit commencer à travailler immédiatement, sans aucune donnée d'entraînement préalable ni de « feuille de triche » avec les bonnes réponses. C'est un « démarrage à froid ».
Comment cela fonctionne (l'analogie créative) :
Au lieu d'étudier pour un examen, l'agent de police utilise une astuce appelée « Apprentissage par l'expérience précoce ».
Le test « Graine » : Avant que le système ne soit mis en ligne, les chercheurs font passer un petit lot de questions à la fois à l'Assistant et à l'Expert. Ils ne se soucient pas encore des bonnes réponses ; ils observent simplement comment les deux se comportent.
- Exemple : Ils remarquent que lorsque la question porte sur un type spécifique de mathématiques, l'Assistant donne une réponse courte et confiante en 2 secondes, tandis que l'Expert prend 300 secondes pour sortir une calculatrice et vérifier deux fois.
- Ils enregistrent ces observations dans un petit « carnet de mémoire ».
La recherche « Ressemblance » : Lorsqu'une nouvelle question arrive, l'agent de police parcourt son carnet de mémoire. Il se demande : « Cette nouvelle question ressemble-t-elle à celles que nous avons vues auparavant ? »
- S'il trouve une correspondance où l'Assistant était rapide et l'Expert lent, il envoie la nouvelle question à l'Assistant.
- S'il trouve une correspondance où l'Assistant était confus ou lent, il envoie la question à l'Expert.
Le raisonnement « Règlement » : Pour s'assurer que l'agent de police ne fait pas que deviner, il suit un Règlement strict (appelé « Raisonnement guidé par une grille »). Il ne se contente pas de « sentir » que l'Expert est nécessaire ; il vérifie des critères spécifiques : « La question similaire passée a-t-elle pris à l'Expert 10 fois plus de temps ? La réponse de l'Assistant semblait-elle vague ? » Cela maintient la décision logique et cohérente.
Les Résultats :
Les chercheurs ont testé ce système sur une nouvelle référence appelée RouteBench (une collection de questions pièges).
- Vitesse : Par rapport à l'utilisation de l'Expert pour tout, ce système était 60 % plus rapide car il évitait de gaspiller du temps sur des questions faciles.
- Précision : Par rapport à l'utilisation de l'Assistant pour tout, il était 28 % plus précis car il ne laissait pas l'Assistant deviner sur les problèmes difficiles.
- Comparaison : Il fonctionnait beaucoup mieux que d'autres méthodes utilisant simplement des invites simples ou des outils de recherche basiques.
En résumé :
Cet article montre que vous n'avez pas besoin d'un vaste ensemble de données d'entraînement pour construire un système intelligent qui sait quand être rapide et quand être méticuleux. En observant simplement comment deux systèmes différents se comportent sur quelques questions échantillons, vous pouvez enseigner à un « agent de police » de router parfaitement les futures questions, en économisant du temps et de l'argent sans sacrifier la qualité.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.