← Derniers articles
💻 computer science

Predicting Performance of Symbolic and Prompt Programs with Examples

Ce papier propose RAP, un cadre de prédiction des performances qui exploite des tâches similaires récupérées et des programmes d'invite pour construire une approximation a priori, résolvant efficacement le problème de la fiabilité du prompting des LLM en distinguant sa distribution de performances diffuse de la nature « tout ou rien » des programmes symboliques.

Auteurs originaux : Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un responsable du recrutement essayant de décider si un nouvel employé est prêt pour un gros poste. Vous avez deux types de candidats : Le Robot (un programme symbolique, comme du code Python) et Le Freelance Créatif (un programme par prompt, qui est une instruction donnée à une IA pour accomplir une tâche).

L'article pose une question simple : Si les deux candidats réussissent quelques petits tests pratiques, pouvons-nous leur faire confiance pour le vrai travail ?

Les auteurs disent : Oui pour le Robot, mais peut-être pas pour le Freelance. Voici pourquoi, en utilisant la logique et les analogies propres à l'article.

1. Les deux types de « programmes »

  • Le Robot (Programme symbolique) : C'est comme une calculatrice stricte. Si vous lui dites « 2 + 2 », il doit répondre « 4 ». Il suit des règles rigides. S'il réussit un test, c'est parce qu'il a suivi les règles parfaitement.
  • Le Freelance (Programme par prompt) : C'est comme demander à un artiste intelligent mais légèrement imprévisible de « dessiner un chat ». Vous donnez à l'artiste un prompt (des instructions). L'artiste peut dessiner un super chat, un chat bizarre, ou un chien. Même s'il réussit quelques tests pratiques, il pourrait simplement avoir de la chance, ou les instructions pourraient être légèrement inadéquates pour le monde réel.

2. Le modèle du « lancer de pièce »

Les auteurs imaginent que chaque fois que le programme exécute un test, c'est comme lancer une pièce.

  • Pile : Le programme a raison.
  • Face : Le programme a tort.

L'objectif est de deviner comment la pièce est « chargée ». Est-ce une pièce équilibrée (50/50) ? Ou est-ce une pièce truquée qui tombe toujours sur Face (100 % de réussite) ?

3. La grande découverte : la « forme » du passé

Avant même de regarder les résultats des tests, les auteurs ont examiné l'histoire de milliers de ces programmes pour voir à quoi ressemblaient habituellement leurs « poids de pièce ». Ils ont trouvé deux formes très différentes :

  • L'histoire du Robot (Tout ou rien) :
    Imaginez un histogramme de tous les programmes Robot. Il ressemble à deux pics hauts aux extrémités.

    • Pic 1 : La plupart des Robots sont parfaits (100 % de réussite).
    • Pic 2 : La plupart des Robots sont cassés (0 % de réussite).
    • Le milieu : Presque rien. Les Robots réussissent rarement « à peu près ». Ils sont soit parfaits, soit ils échouent complètement.
    • Analogie : C'est comme un interrupteur. Il est soit ALLUMÉ, soit ÉTEINT.
  • L'histoire du Freelance (Le nuage diffus) :
    Imaginez un histogramme de tous les programmes Freelance. Il ressemble à un nuage large et plat au milieu.

    • Il y a beaucoup de programmes qui sont « presque justes » (70 %, 80 %, 90 %).
    • Il y en a très peu qui sont parfaits, et très peu qui sont des échecs totaux.
    • Analogie : C'est comme un variateur de lumière. La plupart des freelances sont quelque part au milieu, variant en luminosité.

4. Pourquoi quelques tests vous mentent

Cette différence explique pourquoi quelques tests réussis sont trompeurs pour le Freelance mais rassurants pour le Robot.

  • Pour le Robot : Si vous le voyez réussir 3 tests, vous savez qu'il est probablement l'un de ces pics « parfaits ». Parce que le « terrain d'entente » (où il pourrait être juste moyen) n'existe pas, réussir quelques tests est une garantie forte qu'il continuera à fonctionner.
  • Pour le Freelance : Si vous le voyez réussir 3 tests, il pourrait simplement être l'un de ces programmes « presque justes » qui a eu de la chance. Parce qu'il y a un énorme nuage de programmes « presque justes », réussir quelques tests ne prouve pas qu'il sera parfait plus tard. Il pourrait facilement échouer au suivant.

5. La solution : RAP (L'outil de « recherche de similarité »)

Puisque nous ne pouvons pas faire confiance à quelques tests pour le Freelance, les auteurs ont créé un outil appelé RAP (Retrieved Approximate Prior).

Pensez à RAP comme à un bibliothécaire intelligent.

  1. Le problème : Vous avez un nouveau prompt de Freelance et quelques résultats de tests. Vous ne savez pas s'il est bon.
  2. La bibliothèque : RAP possède une immense bibliothèque d'autres prompts et tâches qui ont été essayés auparavant.
  3. La recherche : RAP regarde votre nouveau prompt et demande : « Qui dans la bibliothèque vous ressemble le plus ? » Il trouve d'autres prompts qui ont résolu des problèmes similaires.
  4. La prédiction : Au lieu de deviner selon une règle générique, RAP regarde comment ces prompts similaires ont performé dans le passé. Il construit une « carte de devinette » personnalisée (un a priori) spécifiquement pour votre prompt.
  5. La mise à jour : Au fur et à mesure que vous exécutez plus de tests, RAP met à jour sa supposition.

Le résultat : RAP est bien meilleur pour prédire si un Freelance réussira que de simplement deviner ou de regarder toute la bibliothèque d'un coup. Il s'adapte au type spécifique de tâche que vous effectuez.

Résumé

  • Les Robots (Code) sont binaires : ils sont soit parfaits, soit cassés. Quelques tests prouvent qu'ils sont parfaits.
  • Les Freelances (Prompts) sont variables : ils sont souvent « presque bons ». Quelques tests ne prouvent pas qu'ils sont fiables.
  • RAP corrige cela en examinant des exemples passés similaires pour faire une supposition plus intelligente sur la performance d'un nouveau prompt, plutôt que de simplement s'appuyer sur quelques exécutions de tests chanceuses.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →