← Derniers articles
💬 NLP

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

Cet article présente une étude empirique démontrant que la recherche basée sur grep surpasse souvent la recherche vectorielle dans les systèmes de recherche agentique, tout en soulignant que la performance globale est significativement influencée par le harnais d'agent et le paradigme d'appel d'outils spécifiques utilisés, même lorsque les données sous-jacentes restent constantes.

Auteurs originaux : Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

Publié 2026-05-15
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective essayant de résoudre une énigme, mais au lieu d'un simple classeur, vous possédez une immense bibliothèque contenant des millions de pages de journaux de conversation. Vous devez trouver des faits précis (comme « À quelle heure a commencé la réunion ? » ou « Quelle est la couleur préférée de l'utilisateur ? ») pour répondre à la question d'un client.

Ce document est un rapport d'une équipe de PwC qui a testé deux méthodes différentes permettant à des « détectives » IA (modèles de langage de grande taille) de parcourir cette bibliothèque. Ils voulaient savoir si l'IA devait utiliser une recherche sémantique intelligente (comme demander à un bibliothécaire « l'histoire de la voiture rouge ») ou une recherche littérale par mots-clés (comme crier « VOITURE ROUGE ! » et parcourir chaque page pour trouver ces mots exacts).

Voici la décomposition de leurs découvertes à l'aide d'analogies simples :

Les deux méthodes de recherche

  1. Recherche vectorielle (Le « Bibliothécaire intelligent ») : Cette méthode comprend le sens de votre question. Si vous demandez un « véhicule rapide », elle peut trouver une page mentionnant une « voiture de sport en excès de vitesse », même si le mot « véhicule » n'y figure pas. Elle est excellente pour comprendre les concepts, mais peut parfois se laisser distraire par des pages qui traitent du sujet sans contenir la réponse exacte.
  2. Recherche Grep (Le « Scanner de mots-clés ») : C'est un instrument brut. Il recherche des mots ou des motifs exacts. Si vous demandez « véhicule rapide », il ne trouvera que les pages contenant ces mots exacts. Il ne comprend pas le sens, mais il est incroyablement précis pour trouver la phrase exacte dont vous avez besoin.

L'expérience : Le « Harnais » compte

Les chercheurs n'ont pas seulement testé les méthodes de recherche ; ils les ont testées dans différents « espaces de travail » (appelés harnais).

  • Harnais personnalisé (Chronos) : Imaginez cela comme une agence de détectives sur mesure. L'IA dispose d'un gestionnaire qui organise les dossiers, indique à l'IA exactement comment poser les questions et formate les réponses parfaitement.
  • Harnais CLI de fournisseurs (Claude Code, Codex, Gemini CLI) : Imaginez ces derniers comme des boîtes à outils du commerce fournies par les géants de la technologie. L'IA reçoit une ligne de commande (comme un terminal) et doit elle-même déterminer comment utiliser des outils standards comme grep.

Les grandes surprises

1. Le scanner « littéral » gagne souvent
Contrairement à la croyance populaire selon laquelle la recherche sémantique « intelligente » est toujours meilleure, l'étude a révélé que le scanner de mots-clés littéral (Grep) était souvent plus précis, en particulier lorsque les réponses étaient des faits spécifiques comme des dates, des noms ou des chiffres.

  • Analogie : Si vous cherchez un numéro de téléphone spécifique dans un livre, crier les chiffres exacts (Grep) est souvent plus fiable que de demander à un bibliothécaire de trouver « les coordonnées » (Vecteur), car le bibliothécaire pourrait vous apporter une page avec un autre numéro de téléphone qui est lié au sujet.

2. La manière dont vous remettez les résultats à l'IA change tout
Les chercheurs ont testé deux façons de fournir les résultats de recherche à l'IA :

  • En ligne (Le « Livre ouvert ») : Les résultats de recherche sont collés directement dans la fenêtre de chat. L'IA les lit immédiatement.
    • Résultat : Grep a dominé ici. Lorsque les mots exacts étaient collés juste devant l'IA, elle donnait les bonnes réponses.
  • Basé sur des fichiers (Le « Classeur ») : Les résultats de recherche sont enregistrés dans un fichier, et l'IA doit effectuer une deuxième étape pour ouvrir et lire ce fichier.
    • Résultat : L'avantage s'est inversé. Parfois, l'IA se perdait dans l'étape supplémentaire consistant à ouvrir le fichier. Dans ces cas, la recherche « intelligente » par vecteurs fonctionnait parfois mieux car elle renvoyait un ensemble plus petit et plus pertinent de résultats, plus faciles à lire. Cependant, pour certains modèles d'IA, la méthode basée sur les fichiers a fait disparaître l'avantage de Grep, voire l'a inversé.

3. Le « Lieu de travail » est plus important que l'« Outil »
La découverte la plus surprenante était que l'environnement (le harnais) comptait plus que l'outil de recherche lui-même.

  • Analogie : C'est comme donner un couteau à un chef étoilé. Si vous le placez dans une cuisine professionnelle avec un sous-chef (Harnais personnalisé), il prépare un repas parfait. Si vous le placez dans une cuisine désordonnée et inconnue, sans instructions (CLI du fournisseur), il pourrait avoir du mal, même avec le même couteau.
  • Le même modèle d'IA (comme Claude Opus) a obtenu un score de 93 % dans le harnais personnalisé, mais seulement 76 % dans le CLI du fournisseur, même en utilisant exactement les mêmes données de recherche. Le « gestionnaire » et les « instructions » ont plus changé le résultat que la méthode de recherche elle-même.

4. Le test du « Bruit »
Les chercheurs ont ajouté de plus en plus de conversations sans rapport (du bruit) à la bibliothèque pour voir comment les méthodes de recherche résistaient.

  • Ils ont constaté que lorsque la bibliothèque devenait plus désordonnée, les résultats étaient imprévisibles. Parfois, le « Bibliothécaire intelligent » (Vecteur) était meilleur pour filtrer le bruit dès le début. D'autres fois, le « Scanner de mots-clés » (Grep) était meilleur pour ignorer le bruit une fois que l'IA avait trouvé le bon motif.
  • Il n'existait aucune méthode « unique » qui fonctionnait pour toutes les situations ; cela dépendait entièrement du modèle d'IA utilisé et de la configuration du « lieu de travail ».

La conclusion

Le document conclut qu'il n'existe pas de « solution miracle » unique pour la recherche IA.

  • Ne supposez pas simplement que la « Recherche sémantique » est l'avenir. Pour les tâches nécessitant des faits exacts, la recherche simple par mots-clés est souvent supérieure.
  • La configuration est tout. La manière dont vous présentez les résultats de recherche à l'IA (directement dans le chat ou dans un fichier) et la façon dont vous gérez le flux de travail de l'IA (instructions personnalisées ou outils bruts) modifie les résultats plus que l'algorithme de recherche lui-même.

En bref : Il ne s'agit pas seulement de ce que l'IA recherche ; il s'agit de comment l'IA est configurée pour effectuer la recherche et de comment les résultats lui sont remis.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →