Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
Dit artikel introduceert Skill Entropy als een nieuwe metriek voor het kwantificeren van de moeilijkheid van het schakelen tussen redeneervaardigheden, stelt de Skill²-Bench benchmark voor om cross-skill langetermijn taken te evalueren, en demonstreert dat een Skill-Entropy RL trainingsframework de prestaties van modellen op deze complexe meerstaps-problemen aanzienlijk verbetert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Naar Skill-Native LLM's: Skill Entropie voor het Benchmarking en Trainen van Long-Horizon Redeneren
1. Probleemstelling
Recente Large Language Models (LLM's) hebben sterke capaciteiten getoond in long-horizon redeneren, wat vooruitgang drijft in diepgaand onderzoek, agentic coding en multi-step planning. Echter, real-world long-horizon taken vereisen vaak cross-skill redeneren: een enkele chain of thought moet vloeiend kunnen schakelen tussen verschillende redeneervaardigheden (bijv. van een wiskundige afleiding naar planning van een schema, en vervolgens naar informatie-extractie).
Bestaande benchmarks evalueren individuele vaardigheden doorgaans in isolatie of ketenen stappen binnen één enkel domein. Ze missen een principieel mechanisme om de moeilijkheid van het wisselen tussen verschillende vaardigheden binnen een redeneerketen te meten of aan te pakken. Empirische observaties suggereren dat hoewel frontier-modellen goed presteren op single-skill benchmarks, ze fragiel zijn in compositionele, cross-skill taken. Deze "skill-switching gap" blijft bestaan, zelfs wanneer het model elk componentdeel afzonderlijk goed beheerst, wat aangeeft dat het vermogen om te wisselen tussen vaardigheden een orthogonale capaciteit is ten opzichte van domeinspecifieke competentie.
2. Methodologie
2.1 Skill Entropy (SkE)
De auteurs introduceren Skill Entropy, een gerichte pairwise maatstaf die de moeilijkheid kwantificeert van het wisselen van de ene vaardigheid naar een andere .
- Definitie: Skill Entropy wordt gedefinieerd als een gesmoothde ratio tussen de gemiddelde single-skill accuratesse en de cross-skill accuratesse onder een vast referentiemodel.
waarbij een Laplace smoothing constante is. - Interpretatie: Een waarde geeft aan dat het ketenen van de twee vaardigheden aanzienlijke moeilijkheid toevoegt vergeleken met het afzonderlijk behandelen ervan (moeilijk te wisselen). Een waarde suggereert dat de switch eenvoudig is.
- Taakniveau Metriek: Voor een cross-skill taak met een skill sequentie , is de taakniveau skill entropy het gemiddelde van de pairwise entropieën langs de sequentie:
2.2 Skill2-Bench
Op basis van het Skill Entropy framework construeren de auteurs Skill2-Bench, een benchmark voor cross-skill long-horizon redeneren.
- Omvang: Het beslaat 558 vaardigheden over 9 domeinen: Wiskunde, Wetenschap, Coding, Logica, Informatie-extractie, Planning, Creatief Schrijven, Context Retrieval en Instructie-opvolging.
- Constructie: Taken worden gesynthetiseerd door skill sequenties te samplen op specifieke entropieniveaus (Laag, Medium, Hoog) en seed vragen te herschrijven naar een coherent scenario waarin elke stap afhankelijk is van de vorige output.
- Evaluatie Protocol: Modellen worden geëvalueerd in twee modi:
- Single-Skill Mode: Stappen worden in isolatie beantwoord.
- Cross-Skill Mode: De volledige long-horizon taak wordt gepresenteerd, wat sequentieel schakelen vereist.
2.3 Skill-Entropy RL
Om de geïdentificeerde kloof aan te pakken, stellen de auteurs Skill-Entropy RL voor, een Reinforcement Learning framework dat skill entropy gebruikt als een trainingssignaal.
- Output Formaat: Het model wordt getraind om een gestructureerde respons uit te stoten voor elke stap, waarbij expliciet zowel de vaardigheid (skill) als het antwoord (answer) wordt voorspeld:
<skill> Domain_Skill </skill><answer> Step Answer </answer> - Reward Functie: De totale beloning combineert step-level correctheid () met een skill-entropy beloning ():
- : Gemiddelde per-step accuratesse gebaseerd op domeinspecifieke scorers.
- : Meet de alignement tussen de voorspelde skill sequentie en de gold skill sequentie door hun taakniveau skill entropy rangen te vergelijken. Dit moedigt het model aan om een skill keten te voorspellen die overeenkomt met het moeilijkheidsprofiel van de grondwaarheid.
- Trainingspipeline: De methode maakt gebruik van een tweestaps proces: Supervised Fine-Tuning (SFT) op skill-geannoteerde traces gevolgd door Group Relative Policy Optimization (GRPO) met de samengestelde beloning.
3. Belangrijkste Resultaten
3.1 Benchmarking Bevindingen (Skill2-Bench)
- Skill-Switching Gap: Evaluatie van 8 frontier en 4 open-source modellen onthult een consistente prestatiedaling naarmate de taakniveau skill entropy toeneemt. De accuratesse daalt bijna monotoon van lage naar hoge entropie taken.
- Cross-Skill Penalty: Wanneer dezelfde vaardigheden binnen een cross-skill taak worden uitgeoefend in plaats van in isolatie, daalt de accuratesse met 4% tot 13% over de modellen heen. Deze penalty blijft bestaan, zelfs voor vaardigheden waarin het model zeer bekwaam is in isolatie (bijv. Logica).
- Foutmodus Analyse: De dominante foutmodus is skill inertia. In latere stappen van een taak hebben modellen de neiging om de vaardigheid en antwoordmodaliteit van de vorige stap te hergebruiken in plaats van te schakelen naar de vereiste vaardigheid. Bijvoorbeeld, een model kan blijven doorgaan met een "Wiskunde" vaardigheid met een numeriek antwoordformaat wanneer de volgende stap een "Creatief Schrijven" vaardigheid vereist met een tekstpassage.
3.2 Trainingsprestaties (Skill-Entropy RL)
- Significante Verbeteringen: Op Qwen3-4B-Instruct verbeterde Skill-Entropy RL de Skill2-Bench score van 34.4% naar 68.4%. Op Qwen3-1.7B verbeterde de score van 14.6% naar 40.1%.
- Vergelijking: De methode presteert beter dan competitieve baselines, inclus_ief standaard GRPO (zonder de entropy reward), SFT, en andere skill-bewuste post-training methoden (Skill-Distill, SkillRL, STAT).
- Generalisatie:
- Open-Ended Domeinen: Ondanks het feit dat er alleen op verifiable domeinen is getraind, vertoonde het model winst in open-ended domeinen (Creatief Schrijven, Context Retrieval), wat suggereert dat het skill-entropy signaal overdraagbaar is naar ongeziene domeinen.
- Off-the-Shelf Data: De pipeline werd succesvol toegepast op OpenR1-Math, een dataset die oorspronkelijk niet gestructureerd was met expliciete skill sequenties. Door bestaande traces te annoteren met skills, bleef de skill-entropy reward de prestaties verbeteren, wat de herbruikbaarheid aantoont.
4. Betekenis en Claims
Het artikel claimt een kritieke kloof aan te pakken in het evalueren en trainen van LLM's voor complexe redenering:
- Nieuwe Metriek: Het introduceert Skill Entropy als een principiële, gerichte pairwise maatstaf om de moeilijkheid van het wisselen tussen vaardigheden te kwantificeren, waarmee het verder gaat dan single-domain evaluatie.
- Benchmark: Skill2-Bench biedt de eerste grootschalige benchmark (558 vaardigheden, 9 domeinen) gekalibreerd door deze metriek, die een structurele "skill-switching gap" blootlegt die single-domain evaluaties missen.
- Trainingssignaal: Het demonstreert dat skill entropy niet alleen een diagnostisch instrument is, maar ook een herbruikbaar trainingssignaal. Door het in de RL reward functie op te nemen, leren modellen expliciet om skill transities te beheren, wat de long-horizon redeneercapaciteiten aanzienlijk verbetert.
- Identificatie van Foutmodus: Het werk identificeert concreet "skill inertia" (het hergebruiken van de vorige stap's skill/modaliteit) als een primaire oorzaak van falen in cross-skill taken en biedt een mechanisme om dit te mitigeren.
De auteurs concluderen dat het afhandelen van skill switches een orthogonale capaciteit is aan domeincompetentie en dat "Skill-Native" LLM's — modellen getraind om hun eigen skill sequenties expliciet te voorspellen en te beheren — een levensvatbaar pad zijn naar robuust long-horizon redeneren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.