← Derniers articles
🤖 AI

YC-Bench\texttt{YC-Bench}: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

Le papier présente YC-Bench\texttt{YC-Bench}, un benchmark open-source évaluant la capacité des agents IA à maintenir une cohérence stratégique sur un horizon d'un an en simulant la gestion d'une startup, révélant que l'utilisation de scratchpads est cruciale pour la réussite et que la détection des clients adverses constitue la principale cause d'échec.

Auteurs originaux : Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

Publié 2026-04-02
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🚀 Le Grand Test de l'Entrepreneur : YC-Bench

Imaginez que vous lancez une startup. Vous avez un budget de départ de 200 000 $. Votre objectif ? Faire fructifier cet argent pendant un an entier (soit environ 365 jours de travail).

Le problème ? Vous ne travaillez pas seul. Vous êtes assisté par une Intelligence Artificielle (IA) qui doit prendre toutes les décisions à votre place : quels contrats accepter, qui embaucher, et comment gérer l'argent.

C'est exactement ce que les chercheurs ont créé avec YC-Bench. C'est un "terrain de jeu" géant pour tester si les IA les plus intelligentes du monde sont capables de gérer une entreprise sur le long terme sans faire faillite.

🎮 Le Jeu : Comment ça marche ?

Pour comprendre le défi, imaginons que l'IA joue à un jeu vidéo de simulation d'entreprise, mais avec des règles très strictes :

  1. La Mémoire à Court Terme (Le "Post-it") :
    L'IA a une mémoire très courte. Elle ne peut se souvenir que des 20 dernières actions. Pour ne pas oublier les choses importantes (comme "ce client est un escroc" ou "cet employé est un génie"), elle doit écrire sur un brouillon numérique (appelé scratchpad).

    • L'analogie : C'est comme si vous deviez gérer un restaurant, mais vous aviez une mémoire de poisson rouge. Vous devez absolument noter sur un petit carnet : "Attention, le client X ne paie jamais !". Si vous ne l'écrivez pas, vous oublierez et vous vous ferez arnaquer à nouveau.
  2. Les Clients Pièges (Les "Vampires") :
    Parmi les clients qui proposent des contrats, certains sont des vampires. Ils promettent beaucoup d'argent, mais une fois le contrat signé, ils demandent un travail impossible à finir à temps.

    • Le piège : L'IA doit apprendre à repérer ces vampires en regardant son historique. Si elle accepte un contrat avec un vampire, elle perd du temps et de l'argent. Si elle ne le repère pas assez vite, elle fait faillite.
  3. La Croissance qui coûte cher :
    Plus l'IA réussit des missions, plus ses employés deviennent compétents... et plus ils demandent une augmentation de salaire !

    • Le dilemme : Si l'IA embauche trop de monde ou accepte trop de petits contrats, les salaires vont manger tout le bénéfice. Elle doit trouver l'équilibre parfait entre "faire du profit" et "ne pas se ruiner en salaires".

🏆 Les Résultats : Qui a gagné ?

Les chercheurs ont mis en compétition 12 IA différentes (les plus puissantes du monde, comme celles de Google, OpenAI, Anthropic, etc.). Voici ce qui s'est passé :

  • La majorité a échoué : Sur 12 IA, 7 ont fait faillite (elles ont perdu tout leur argent). Beaucoup d'entre elles ont oublié de noter les clients dangereux sur leur "brouillon" et se sont fait piéger encore et encore.
  • Les 3 champions : Seules 3 IA ont réussi à transformer les 200 000 $ initiaux en une fortune.
    • La gagnante est Claude Opus 4.6, qui a fini avec 1,27 million de dollars.
    • La deuxième est GLM-5, avec 1,21 million de dollars.
    • La troisième est GPT-5.4.

💡 La Leçon Principale : La Mémoire est la Clé

La découverte la plus importante de l'étude est simple : ceux qui gagnent sont ceux qui écrivent le mieux sur leur "brouillon".

  • Les IA qui ont gagné ont utilisé leur brouillon pour créer des règles claires : "Ne jamais travailler avec le client X", "Faire confiance au client Y".
  • Les IA qui ont perdu ont soit oublié d'écrire ces règles, soit elles ont écrit la règle mais ne l'ont pas suivie (comme un humain qui dit "Je vais arrêter de fumer" et fume une cigarette cinq minutes plus tard).

🤖 Le Paradoxe du Coût

Il y a une surprise amusante dans les résultats :

  • L'IA la plus performante (Claude Opus) a gagné le plus d'argent, mais elle est très chère à faire tourner (elle coûte cher en calcul).
  • Une autre IA (Kimi-K2.5) a gagné moins d'argent, mais elle l'a fait beaucoup moins cher. En termes de "rendement pour l'argent dépensé", elle est la plus efficace.

🎯 En Résumé

Ce papier nous dit une chose fondamentale : Être intelligent ne suffit pas.

Pour réussir dans un monde complexe et sur le long terme, une IA doit avoir trois choses :

  1. Une bonne mémoire (savoir noter les leçons apprises).
  2. La discipline (suivre ses propres notes).
  3. La capacité d'adaptation (reconnaître les pièges et changer de stratégie).

Aujourd'hui, même les IA les plus avancées du monde ont encore du mal à faire ces trois choses en même temps sur une longue période. YC-Bench est donc un outil précieux pour voir où elles échouent et comment les rendre plus "sages" pour l'avenir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →