Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
Cet article introduit l'Entropie de Compétence (Skill Entropy) en tant que nouvelle métrique pour quantifier la difficulté du passage d'une compétence de raisonnement à une autre, propose le benchmark Skill²-Bench pour évaluer les tâches à long horizon inter-compétences, et démontre qu'un cadre d'entraînement par renforcement basé sur l'Entropie de Compétence améliore significativement les performances des modèles sur ces problèmes complexes à étapes multiples.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : Vers des LLM « Skill-Native » : L'Entropie de Compétence pour l'Évaluation et l'Entraînement du Raisonnement à Longue Horizon
1. Énoncé du Problème
Les modèles de langage de grande taille (LLM) récents ont démontré de solides capacités de raisonnement à longue horizon, stimulant les progrès dans la recherche approfondie, le codage agentique et la planification multi-étapes. Cependant, les tâches réelles à longue horizon nécessitent souvent un raisonnement inter-compétences (cross-skill reasoning) : une chaîne de pensée unique doit passer de manière fluide entre des compétences de raisonnement distinctes (par exemple, d'une dérivation mathématique à la planification d'un emploi du temps, puis à l'extraction d'informations).
Les benchmarks existants évaluent généralement les compétences individuelles de manière isolée ou enchaînent des étapes au sein d'un seul domaine. Ils manquent d'un mécanisme principled pour mesurer ou traiter la difficulté du changement de compétence au sein d'une chaîne de raisonnement. Des observations empiriques suggèrent que si les modèles de pointe performent bien sur des benchmarks à compétence unique, ils font preuve de fragilité dans les tâches composées inter-compétences. Ce « fossé de changement de compétence » (skill-switching gap) persiste même lorsque le modèle gère bien chaque composante de compétence en isolation, indiquant que la capacité à changer de compétence est une capacité orthogonale à la compétence spécifique au domaine.
2. Méthodologie
2.1 Entropie de Compétence (SkE)
Les auteurs introduisent l'Entropie de Compétence (Skill Entropy), une mesure de paire dirigée quantifiant la difficulté de passer d'une compétence à une autre .
- Définition : L'Entropie de Compétence est définie comme un ratio lissé entre la précision moyenne de la compétence unique et la précision inter-compétences sous un modèle de référence fixe.
où est une constante de lissage de Laplace. - Interprétation : Une valeur indique que l'enchaînement des deux compétences ajoute une difficulté significative par rapport à leur traitement en isolation (difficile à changer). Une valeur suggère que le changement est facile.
- Métrique au niveau de la tâche : Pour une tâche inter-compétences avec une séquence de compétences , l'entropie de compétence au niveau de la tâche est la moyenne des entropies de paires le long de la séquence :
2.2 Skill2-Bench
Sur la base du cadre d'Entropie de Compétence, les auteurs construisent Skill2-Bench, un benchmark pour le raisonnement inter-compétences à longue horizon.
- Portée : Il couvre 558 compétences réparties dans 9 domaines : Mathématiques, Sciences, Codage, Logique, Extraction d'Information, Planification, Écriture Créative, Récupération de Contexte et Suivi d'Instructions.
- Construction : Les tâches sont synthétisées en échantillonnant des séquences de compétences à des niveaux d'entropie spécifiques (Faible, Moyen, Élevé) et en réécrivant des questions germes dans un scénario cohérent où chaque étape dépend de la sortie précédente.
- Protocole d'Évaluation : Les modèles sont évalués selon deux modes :
- Mode Compétence Unique : Les étapes sont répondues de manière isolée.
- Mode Inter-Compétences : La tâche complète à longue horizon est présentée, nécessitant un changement séquentiel.
2.3 RL par Entropie de Compétence (Skill-Entropy RL)
Pour combler le fossé identifié, les auteurs proposent le Skill-Entropy RL, un cadre d'Apprentissage par Renforcement (Reinforcement Learning) qui utilise l'entropie de compétence comme signal d'entraînement.
- Format de Sortie : Le modèle est entraîné à émettre une réponse structurée pour chaque étape, prédisant explicitement à la fois la compétence utilisée et la réponse :
<skill> Domaine_Compétence </skill><answer> Réponse_Étape </answer> - Fonction de Récompense : La récompense totale combine la correction par étape () avec une récompense d'entropie de compétence () :
- : Précision moyenne par étape basée sur des évaluateurs spécifiques au domaine.
- : Mesure l'alignement entre la séquence de compétences prédite et la séquence de compétences de référence en comparant leurs rangs d'entropie de compétence au niveau de la tâche. Cela encourage le modèle à prédire une chaîne de compétences qui correspond au profil de difficulté de la vérité terrain.
- Pipeline d'Entraînement : La méthode utilise un processus en deux étapes : un Ajustement Supervisé (SFT) sur des traces annotées par compétences, suivi d'une Optimisation de Politique Relative de Groupe (GRPO) utilisant la récompense composite.
3. Résultats Clés
3.1 Résultats du Benchmark (Skill2-Bench)
- Fossé de Changement de Compétence : L'évaluation de 8 modèles de pointe et 4 modèles open-source révèle une baisse de performance constante à mesure que l'entropie de compétence de la tâche augmente. La précision diminue de manière presque monotone des tâches à faible entropie vers les tâches à haute entropité.
- Pénalité Inter-Compétences : Lorsque les mêmes compétences sont exercées au sein d'une tâche inter-compétences plutôt qu'en isolation, la précision chute de 4 % à 13 % selon les modèles. Cette pénalité persiste même pour les compétences dans lesquelles le modèle est très performant en isolation (ex: Logique).
- Analyse des Modes de Défaillance : Le mode de défaillance dominant est l'inertie de compétence. Dans les étapes ultérieures d'une tâche, les modèles ont tendance à réutiliser la compétence et la modalité de réponse de l'étape précédente plutôt que de changer de compétence requise. Par exemple, un modèle pourrait continuer à utiliser une compétence « Math » avec un format de réponse numérique alors que l'étape suivante nécessite une compétence « Écriture Créative » avec un passage textuel.
3.2 Performance de l'Entraînement (Skill-Entropy RL)
- Améliorations Significatives : Sur Qwen3-4B-Instruct, le Skill-Entropy RL a amélioré le score Skill2-Bench de 34,4 % à 68,4 %. Sur Qwen3-1.7B, le score est passé de 14,6 % à 40,1 %.
- Comparaison : La méthode surpasse les bases compétitives, y compris le GRPO standard (sans la récompense d'entropie), le SFT et d'autres méthodes de post-entraînement sensibles aux compétences (Skill-Distill, SkillRL, STAT).
- Généralisation :
- Domaines Ouverts : Malgré un entraînement uniquement sur des domaines vérifiables, le modèle a montré des gains dans les domaines ouverts (Écriture Créative, Récupération de Contexte), suggérant que le signal d'entropie de compétence se transfère aux domaines non vus.
- Données Prêtes à l'Emploi : Le pipeline a été appliqué avec succès à OpenR1-Math, un ensemble de données qui n'était pas initialement structuré avec des séquences de compétences explicites. En annotant les traces existantes avec des compétences, la récompense d'entropie de compétence a continué d'améliorer les performances, démontant sa réutilisabilité.
4. Signification et Revendications
Le papier prétend répondre à une lacune critique dans l'évaluation et l'entraînement des LLM pour le raisonnement complexe :
- Nouvelle Métrique : Il introduit l'Entropie de Compétence comme une mesure de paire dirigée et fondée pour quantifier la difficulté du changement de compétence, allant au-delà de l'évaluation par domaine unique.
- Benchmark : Skill2-Bench fournit le premier benchmark à grande échelle (558 compétences, 9 domaines) calibré par cette métrique, exposant un « fossé de changement de compétence » structurel que les évaluations à domaine unique ne voient pas.
- Signal d'Entraînement : Il démontre que l'entropie de compétence n'est pas seulement un outil de diagnostic mais un signal d'entraînement réutilisable. En l'incorporant dans la fonction de récompense par apprentissage par renforcement, les modèles apprennent à gérer explicitement les transitions de compétences, améliorant considérablement les capacités de raisonnement à longue horizon.
- Identification du Mode de Défaillance : Le travail identifie concrètement l'« inertie de compétence » (réutilisation de la compétence/modalité de l'étape précédente) comme une cause primaire d'échec dans les tâches inter-compétences et fournit un mécanisme pour l'atténuer.
Les auteurs concluent que la gestion des changements de compétences est une capacité orthogonale à la compétence de domaine et que les LLM « Skill-Native » — des modèles entraînés pour prédire et gérer explicitement leurs propres séquences de compétences — constituent une voie viable vers un raisonnement robuste à longue horizon.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.