When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
Dit artikel introduceert Side-by-Side (SxS) Interleaved Reasoning, een raamwerk dat grote taalmodellen in staat stelt om dynamisch het tijdstip van inhoudsopenbaarmaking tijdens generatie te beheersen om de afweging tussen deliberatietijd en voortijdige toewijzing in evenwicht te brengen, waardoor de prestaties op het gebied van nauwkeurigheid en latentie op diverse benchmarks worden verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar zeer voorzichtige vriend vraagt om hulp bij een complex raadsel.
De Oude Manier: De "Stiltebelasting"
Bij de huidige manier waarop Large Language Models (LLMs) werken, moet je vriend hardop denken. Maar hier zit de adder onder het gras: zodra ze een woord zeggen, is dat woord publiek. Ze kunnen het niet terugnemen.
- Als ze stil blijven om diep na te denken, zit jij daar in een ongemakkelijke stilte te wachten (de "Stiltebelasting").
- Als ze direct beginnen te praten om beleefd te zijn, zeggen ze misschien iets verkeerds of halfbakkigs. Omdat ze het al hebben gezegd, zijn ze nu "vastgelegd" bij dat idee, wat het voor hen moeilijker kan maken om later hun koers te corrigeren. Ze worden gedwongen om verder te bouwen op een wankel fundament, alleen maar omdat ze te vroeg hebben gesproken.
Het Nieuwe Idee: Zij-aan-zij (SxS) Redeneren
Dit artikel introduceert een nieuwe manier voor de AI om te spreken, genaamd Side-by-Side (SxS) Interleaved Reasoning (Zij-aan-zij Verweven Redeneren).
Stel je het voor als een live kookshow met een geheim ingrediënt.
- De "Denk"-Modus (Privé): De chef (de AI) is in de keuken, snijdt, proeft en mengt ingrediënten. Dit deel kun je niet zien. Het is hun privéwerkplek.
- De "Spreek"-Modus (Publiek): De chef stapt naar het aanrecht en vertelt je: "Ik voeg nu zout toe."
- De Magische Regel: De chef mag alleen naar buiten stappen en spreken als ze het gerecht al hebben geproefd en 100% zeker weten dat het zout de juiste zet is. Ze roepen niet zomaar gissingen om de stilte te vullen.
Hoe Het Werkt (De "Afleiding"-Truc)
Het artikel leert de AI een specifieke regel: "Spreek niet totdat je denken ondersteunt wat je gaat zeggen."
- De Chef Opleiden: De onderzoekers namen duizenden voorbeelden waar een AI een probleem oploste. Ze gebruikten een "toezichthouder" (een andere AI) om te controleren: "Bewijst deze specifieke denkstap daadwerkelijk deze specifieke antwoordstap?"
- De Verweven Dans: Ze creëerden een nieuw trainingsformaat waarbij de AI oefent om heen en weer te schakelen tussen "Denken" (privé) en "Spreken" (publiek).
- Denk: "Ik moet het oppervlak berekenen." (Privé)
- Denk: "De formule is lengte maal breedte." (Privé)
- Spreek: "Het oppervlak is 50." (Publiek, omdat het denken het zojuist heeft bewezen).
- Denk: "Wacht, laat me de eenheden nog eens controleren." (Privé)
- Spreek: "Dus, 50 vierkante meter." (Publiek).
De Resultaten: Het Beste van Beide Werelden
Het artikel testte dit op wiskundeproblemen (AIME25) en wetenschapsvragen (GPQA-Diamond) met twee verschillende maten van AI-modellen.
- Snellere Updates: In plaats van 20.000 tokens (een zeer lange tijd) te wachten op het uiteindelijke antwoord, geeft de AI je nu veel eerder kleine, geverifieerde stukken van het antwoord. Het is alsof je een voortgangsbalk krijgt die echt beweegt, in plaats van een draaiend wieltje.
- Geen "Opvulsel": Omdat de AI is getraind om alleen te spreken als ze bewijs heeft, babbelt ze niet zomaar onzin om de stilte te vullen.
- Nauwkeurigheid Blijft Hoog: Soms maakt het dwingen van een AI om vroeg te praten haar dommer. Maar omdat deze methode een twee-staps trainingsproces gebruikt (eerst leren hoe je de modi wisselt, en vervolgens versterkende leer gebruiken om ervoor te zorgen dat de antwoorden nog steeds correct zijn), blijft de AI slim.
- De "Pareto"-Winst: Het artikel beweert dat dit een betere balans creëert (een "Pareto-trade-off"). Je krijgt snellere, frequentere updates zonder de kwaliteit van het uiteindelijke antwoord te offeren.
Samenvattend
Dit artikel lost de "Stiltebelasting" op door de AI te leren een zelfverzekerde, geverifieerde spreker te zijn. Het stelt het model in staat om zijn "denkhoed" op te houden terwijl het werkt, en deze alleen af te nemen om een stukje van de oplossing te delen wanneer het weet dat dat stukje stevig is. Dit maakt de interactie sneller en responsiever aanvoelend, zonder de AI te dwingen te gokken of te liegen om de stilte te vullen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.