← Derniers articles
💬 NLP

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

IterResearch introduit un paradigme de recherche approfondie itérative basé sur la mise à l'échelle de l'interaction (Interaction Scaling) et une reconstruction de l'espace de travail inspirée des processus de décision de Markov (MDP), qui surmonte les limitations de contexte des agents existants pour obtenir des gains de performance significatifs sur des tâches à long horizon, tant en tant que modèle entraîné qu'en tant que stratégie de prompting pour les systèmes de pointe.

Auteurs originaux : Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Z
Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Grand Problème : Le Piège du « Défilement Infini »

Imaginez que vous essayez de résoudre un mystère très difficile, comme trouver un fait spécifique caché au fond d'Internet.

La plupart des agents IA actuels travaillent comme une personne qui essaie de lire un livre en ne tournant jamais la page. Ils commencent à lire la page 1, puis la page 2, puis la page 3. Mais au lieu de fermer les anciennes pages et de repartir de zéro, ils continuent d'ajouter de nouvelles pages au bas de la même pile géante.

  • Le Résultat : Après 50 pages, la pile est si haute que la personne ne voit plus le haut. Elle est « étouffée » par tout le texte ancien.
  • Le Bruit : S'ils lisent accidentellement une mauvaise information à la page 5, ce faux fait reste coincé dans la pile pour toujours, les confondant à la page 50.

L'article appelle cela le « Paradigme Mono-contextuel ». C'est comme essayer de courir un marathon en traînant un sac à dos lourd qui devient de plus en plus pesant à chaque pas. Finalement, on s'effondre.

La Solution : Le « Carnet Intelligent » (IterResearch)

Les auteurs introduisent IterResearch, une nouvelle façon pour l'IA de réfléchir. Au lieu de traîner une pile de papiers géante, l'IA utilise un Carnet Intelligent qui est réécrit chaque fois qu'elle apprend quelque chose de nouveau.

Voici comment cela fonctionne, étape par étape :

  1. Le Bouton « Reset » :
    Imaginez que vous êtes un détective. Vous rassemblez des indices pendant un certain temps. Au lieu de garder chaque petit morceau de papier que vous avez touché, vous vous asseyez, vous écrivez un résumé de ce que vous savez jusqu'à présent dans un carnet propre, puis vous jetez les débris désordonnés.
  • Le terme de l'article : Reconstruction Itérative de l'Espace de Travail (Iterative Workspace Reconstruction).
  • L'analogie : L'IA nettoie son bureau, ne garde que l'essentiel du « Dossier de l'Affaire » (le rapport) et commence la prochaine phase d'enquête avec une page blanche et propre. Cela évite l'« étouffement » causé par trop de texte ancien.
  1. Le Rapport « Évolutif » :
    L'IA ne se contente pas de mémoriser des faits ; elle écrit un rapport vivant. Chaque fois qu'elle trouve une nouvelle information, elle met à jour ce rapport, filtrant les déchets pour ne garder que l'or.
  • Le terme de l'article : Mémoire de Rapport Évolutive (Evolving Report Memory).
  • L'analogie : C'est comme une page Wikipédia que l'IA édite en temps réel. Les informations anciennes, fausses ou non pertinentes sont supprimées ; les nouvelles informations correctes sont ajoutées. La « mémoire » reste petite et propre, peu importe la durée de l'enquête.
  1. Le Coach d'Efficacité :
    L'IA doit apprendre à chercher de manière efficace. L'article introduit une méthode d'entraînement appelée EAPO (Optimisation de Politique Sensible à l'Efficacité).
  • L'analogie : Imaginez un coach qui vous donne une étoile dorée pour avoir résolu un puzzle en 5 coups, mais seulement une petite étoile terne pour l'avoir résolu en 50 coups. Même si vous trouvez la bonne réponse, le coach vous apprend à être plus rapide et plus intelligent, plutôt que de simplement continuer à creuser jusqu'à ce que vous ayez de la chance.

Les Résultats Incroyables

L'article a testé cette nouvelle méthode de « Carnet Intelligent » contre les anciennes méthodes de « Défilement Infini ». Voici ce qui s'est passé :

  • Battre la Concurrence : La nouvelle IA (IterResearch) a obtenu des scores nettement plus élevés sur six tests difficiles différents que n'importe quel autre agent IA open-source. Elle a réduit l'écart avec les systèmes propriétaires les plus coûteux (comme ceux de Google ou OpenAI).
  • Le Marathon « Super-Long » : Le résultat le plus frappant était le Scaling d'Interaction (Interaction Scaling).
    • L'analogie : Les anciens agents abandonnent généralement ou se confonde après environ 20 ou 30 étapes parce que leur « sac à dos » est trop lourd. IterResearch a été capable de courir pendant 2 048 étapes sans sourciller.
    • Le Résultat : Lorsqu'on lui permet de faire plus d'étapes (jusqu'à 2 048), ses performances sont passées d'un médiocre 3,5 % à un incroyable 42,5 %. Cela a prouvé que le problème n'était pas que l'IA était « trop stupide » pour résoudre la tâche, mais que les anciennes méthodes ne lui permettaient pas de regarder assez longtemps.
  • Un Truc Universel : Les auteurs ont découvert qu'il n'est même pas nécessaire de réentraîner l'IA pour utiliser cette méthode. Si vous donnez simplement les instructions du « Carnet Intelligent » (un prompt) à une autre IA puissante, celle-ci devient instantanément bien meilleure pour les tâches longues. C'est comme donner à une lampe torche standard un nouvel objectif qui lui permet de voir beaucoup plus loin.

Résumé

IterResearch est une nouvelle façon pour l'IA de mener des recherches approfondies. Au lieu d'accumuler chaque morceau d'information trouvé (ce qui finit par étouffer l'IA), elle résume périodiquement ce qu'elle sait, jette le bruit et repart sur de nouvelles bases.

Cela permet à l'IA de :

  1. Penser clairement pendant des périodes beaucoup plus longues (jusqu'à 2 048 étapes).
  2. Trouver des réponses plus efficacement.
  3. Mieux travailler que presque tous les agents open-source actuellement disponibles.

Cela transforme l'IA d'une personne se noyant sous une pile de papiers en un détective possédant un dossier d'affaire parfaitement organisé et mis à jour en permanence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →