← Derniers articles
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

Ce papier présente le raisonnement entrelacé côte à côte (SxS), un cadre permettant aux grands modèles de langage de contrôler dynamiquement le moment de la divulgation du contenu lors de la génération afin d'équilibrer le compromis entre le temps de réflexion et l'engagement prématuré, améliorant ainsi les performances précision-latence sur divers benchmarks.

Auteurs originaux : Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

Publié 2026-05-06
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous demandez de l'aide à un ami brillant mais très prudent pour résoudre un puzzle complexe.

L'Ancienne Méthode : La « Taxe du Silence »
Dans le fonctionnement actuel des grands modèles de langage (LLM), votre ami doit penser à voix haute. Mais voici le hic : dès qu'il prononce un mot, ce mot devient public. Il ne peut pas le reprendre.

  • S'il reste silencieux pour réfléchir profondément, vous restez assis dans un silence gênant (la « Taxe du Silence »).
  • S'il commence à parler immédiatement par politesse, il risque de dire quelque chose de faux ou d'inachevé. Parce qu'il l'a déjà dit, il est désormais « engagé » envers cette idée, ce qui peut rendre plus difficile la correction de sa trajectoire plus tard. Il est contraint de continuer à bâtir sur des fondations fragiles simplement parce qu'il a parlé trop tôt.

La Nouvelle Idée : Le Raisonnement Côté à Côté (SxS)
Ce papier introduit une nouvelle façon pour l'IA de parler, appelée Raisonnement Entrelacé Côté à Côté (SxS).

Pensez-y comme à un show culinaire en direct avec un ingrédient secret.

  • Le Mode « Réfléchir » (Privé) : Le chef (l'IA) est dans la cuisine, il hache, goûte et mélange les ingrédients. Vous ne pouvez pas voir cette partie. C'est son espace de travail privé.
  • Le Mode « Parler » (Public) : Le chef sort au comptoir et vous dit : « J'ajoute du sel maintenant. »
  • La Règle Magique : Le chef n'a le droit de sortir et de parler que s'il a déjà goûté le plat et qu'il est à 100 % certain que le sel est la bonne décision. Il ne crie pas simplement des hypothèses pour combler le silence.

Comment Cela Fonctionne (L'« Astuce de l'Implication »)
Le papier enseigne à l'IA une règle spécifique : « Ne parlez pas tant que votre réflexion ne soutient pas ce que vous allez dire. »

  1. Entraîner le Chef : Les chercheurs ont pris des milliers d'exemples où une IA résolvait un problème. Ils ont utilisé un « superviseur » (une autre IA) pour vérifier : « Est-ce que cette étape de pensée spécifique prouve réellement cette étape de réponse spécifique ? »
  2. La Danse Entrelacée : Ils ont créé un nouveau format d'entraînement où l'IA s'entraîne à basculer en arrière et en avant entre « Réfléchir » (privé) et « Parler » (public).
    • Réfléchir : « Je dois calculer l'aire. » (Privé)
    • Réfléchir : « La formule est longueur fois largeur. » (Privé)
    • Parler : « L'aire est de 50. » (Public, car la réflexion vient de le prouver).
    • Réfléchir : « Attends, laissez-moi vérifier les unités. » (Privé)
    • Parler : « Donc, 50 mètres carrés. » (Public).

Les Résultats : Le Meilleur des Deux Mondes
Le papier a testé cela sur des problèmes de mathématiques (AIME25) et des questions scientifiques (GPQA-Diamond) en utilisant deux tailles différentes de modèles d'IA.

  • Mises à Jour Plus Rapides : Au lieu d'attendre 20 000 jetons (un temps très long) pour la réponse finale, l'IA vous donne maintenant de petits morceaux vérifiés de la réponse beaucoup plus tôt. C'est comme obtenir une barre de progression qui bouge réellement, plutôt qu'une roue qui tourne.
  • Pas de « Remplissage » : Parce que l'IA est entraînée à ne parler que lorsqu'elle a une preuve, elle ne bavarde pas de bêtises pour combler le silence.
  • La Précision Reste Élevée : Parfois, forcer une IA à parler tôt la rend plus bête. Mais parce que cette méthode utilise un processus d'entraînement en deux étapes (d'abord apprendre comment changer de mode, puis utiliser l'apprentissage par renforcement pour s'assurer que les réponses restent correctes), l'IA reste intelligente.
  • La Victoire « Pareto » : Le papier affirme que cela crée un meilleur équilibre (un « compromis Pareto »). Vous obtenez des mises à jour plus rapides et plus fréquentes sans sacrifier la qualité de la réponse finale.

En Résumé
Ce papier résout la « Taxe du Silence » en enseignant à l'IA à être un orateur confiant et vérifié. Il permet au modèle de garder son « chapeau de réflexion » pendant qu'il travaille, et de ne l'enlever que pour partager un morceau de la solution lorsqu'il sait que ce morceau est solide. Cela rend l'interaction plus rapide et plus réactive, sans forcer l'IA à deviner ou à mentir pour combler le silence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →