← Derniers articles
💬 NLP

Retrieved In-Context Principles from Previous Mistakes

Le papier propose les Principes Récupérés en Contexte (RICP), un cadre enseignant-élève qui analyse et regroupe les erreurs des modèles étudiants pour générer des principes personnalisés au niveau des tâches afin d'améliorer les performances des grands modèles de langage sur divers benchmarks de raisonnement.

Auteurs originaux : Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Publié 2026-05-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un élève (le Modèle Élève) comment résoudre des énigmes complexes. Habituellement, nous enseignons en lui montrant des exemples parfaits de la manière de bien faire. Mais cet article soutient que nous pouvons l'enseigner encore mieux en lui montrant où il s'est trompé et en expliquant pourquoi.

Les auteurs appellent leur nouvelle méthode RICP (Principes Récupérés en Contexte). Pensez-y comme à un système de tutorat intelligent en deux étapes impliquant un Enseignant et un Élève.

Voici comment cela fonctionne, en utilisant une analogie simple :

Le Problème : Le Manuel "Taille Unique"

Les méthodes précédentes tentaient d'apprendre des erreurs, mais elles ressemblaient à remettre à l'élève un chapitre de manuel générique intitulé « Comment éviter les erreurs ».

  • Le Défaut : Si l'élève est bloqué sur un problème de mathématiques concernant une pizza, lire une règle générique sur « vérifier votre travail » pourrait ne pas suffire. Inversement, si l'élève résout une énigme logique, une règle sur « les mathématiques de la pizza » est inutile.
  • Le Résultat : Les conseils étaient soit trop vagues, soit ne couvraient pas suffisamment les différents types d'erreurs.

La Solution : Le « Tuteur Personnalisé » (RICP)

La méthode RICP agit comme un maître enseignant qui observe l'élève passer un test d'entraînement, analyse ses erreurs spécifiques, puis crée un guide d'étude personnalisé pour le prochain test.

Étape 1 : L'« Autopsie de l'Erreur » (Génération d'Insights)

D'abord, le Modèle Élève tente de résoudre un tas de problèmes d'entraînement. Le Modèle Enseignant (une IA plus intelligente) examine ceux que l'Élève a ratés.

  • Ce que fait l'Enseignant : Au lieu de simplement dire « Faux », l'Enseignant rédige un rapport. Il identifie la Cause Racine (par exemple : « Vous avez oublié d'ajouter le pourboire au prix de la pizza ») et fournit des Insights spécifiques (par exemple : « Vérifiez toujours si vous avez inclus chaque partie du coût total »).

Étape 2 : La « Bibliothèque de Leçons » (Formulation de Principes)

C'est ici que la magie opère. L'Enseignant organise ces erreurs en deux types de conseils :

  1. Les « Règles Générales » (Principes au Niveau de la Tâche) :

    • Analogie : Imaginez un Chapitre de Manuel.
    • L'Enseignant regroupe les erreurs similaires (par exemple, toutes les erreurs de mathématiques concernant les proportions). À partir de ces groupes, il rédige des règles larges qui s'appliquent à n'importe quel problème de mathématiques.
    • Exemple : « Vérifiez toujours vos opérations arithmétiques. »
  2. La « Triche Personnalisée » (Principes au Niveau de la Question) :

    • Analogie : Imaginez un Post-it sur le problème spécifique que vous regardez en ce moment.
    • Pour la question exacte que l'Élève est sur le point de répondre, l'Enseignant recherche dans la bibliothèque les erreurs passées les plus similaires. Il extrait ensuite les conseils spécifiques qui s'appliquent uniquement à cette situation.
    • Exemple : « Pour ce problème de pizza spécifique, rappelez-vous d'ajouter le pourboire au prix de base, et pas seulement de calculer le pourboire. »

Étape 3 : Le « Jour de l'Examen » (Utilisation des Principes)

Lorsque l'Élève fait face à une nouvelle question :

  1. Il reçoit les Règles Générales (le chapitre du manuel) pour rester sur la bonne voie.
  2. Il reçoit la Triche Personnalisée (le Post-it) adaptée à cette question spécifique.
  3. Il combine ces éléments avec ses instructions normales pour résoudre le problème.

Crucialement : L'Enseignant n'a pas besoin d'être présent pendant l'examen. L'Élève utilise simplement les notes que l'Enseignant a préparées plus tôt. Cela rend l'exécution rapide et peu coûteuse.

Pourquoi est-ce mieux ?

L'article a testé cela sur sept différents « conseils d'examen » (ensembles de données) impliquant des mathématiques, le sens commun et la logique.

  • Personnalisation : Contrairement aux anciennes méthodes qui donnaient les mêmes conseils à tout le monde, RICP donne le bon conseil pour la question spécifique.
  • Couverture : En regroupant les erreurs, il garantit que l'Élève apprend d'une grande variété d'erreurs, et pas seulement des plus courantes.
  • Résultats : Lorsqu'ils ont ajouté ces « Notes d'Erreurs » aux méthodes de promptage standard de l'IA, les Modèles Élèves sont devenus significativement plus intelligents et plus précis, en particulier sur les problèmes de logique et de mathématiques difficiles.

En Résumé

Au lieu de simplement montrer à une IA comment bien faire les choses, cette méthode lui apprend comment éviter de mal faire en analysant ses échecs passés. Elle crée un guide hybride offrant à la fois une sagesse large (pour la sécurité générale) et des conseils spécifiques (pour le problème immédiat), aidant l'IA à raisonner beaucoup plus comme un humain qui apprend de ses propres erreurs.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →