← Nieuwste papers
💬 NLP

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

Dit artikel introduceert Local Branch Routing (LBR), een framework voor schalen op tokenniveau tijdens de testtijd dat het redeneren van taalmodellen efficiënt verbetert door lokale lookahead-bomen uit te breiden en een lichtgewicht router te gebruiken om optimale takken te selecteren, waardoor end-to-end reinforcement learning mogelijk wordt en bestaande discrete chain-of-thought en soft-token baselines op wiskundige redeneertaken wordt overtroffen.

Oorspronkelijke auteurs: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Te Langzaam of Te Nauw Denken

Stel je voor dat je probeert een heel moeilijk wiskundig probleem op te lossen of een complexe reis te plannen. Je hebt een slimme assistent (de AI) die je helpt.

Momenteel werken AI-assistenten meestal op één van twee manieren:

  1. De "Eén-Pad" Wandelaar: Ze denken stap voor stap en committeren zich aan het allereerste idee dat in hen opkomt. Als ze vroegtijdig een verkeerde afslag nemen, kunnen ze vast komen te zitten, omdat ze nooit naar de andere opties hebben gekeken.
  2. De "Volledige Kaart" Ontdekkingsreiziger: Ze proberen in één keer elke mogelijke oplossingsroute uit te schrijven, controleren ze allemaal en kiezen de beste. Dit is zeer accuraat, maar het is alsof je elk boek in een bibliotheek probeert te lezen om één specifieke zin te vinden — het kost te veel tijd en rekenkracht.

De auteurs van dit paper wilden een "Goldilocks"-oplossing vinden: een manier om naar een paar verschillende mogelijkheden te kijken om een betere keuze te maken, zonder erdoorheen te zinken door alles te willen controleren.

De Oplossing: Local Branch Routing (LBR)

De auteurs stellen een nieuwe methode voor genaamd Local Branch Routing. Beschouw dit als een "Vooruitkijken, dan Beslissen"-strategie.

Zo werkt het, stap voor stap, met de analogie van een wandelaar die een pad kiest:

1. Het "Vooruitkijken" (De boom laten groeien)

In plaats van onmiddellijk het volgende woord (of het volgende pad) te kiezen, pauzeert de AI. Het stelt zich de volgende paar woorden (of padmarkeringen) voor alsof ze echt zijn.

  • De term uit het paper: Expands a small local lookahead tree.
  • De analogie: Stel je voor dat je bij een splitsing in de weg staat. In plaats van direct een pad te kiezen, loop je snel 3 stappen over Pad A, 3 stappen over Pad B en 3 stappen over Pad C. Je committeert je nog niet aan een van de paden; je "loopt" ze alleen in je gedachten om te zien hoe het terrein eruitziet.

2. De "Router" (De Beslisser)

Zodra de AI deze korte paden heeft "gelopen", kijkt het naar de resultaten. Het vraagt zich af: "Welk van deze korte paden ziet er het meest veelbelovend uit?"

  • De term uit het paper: Uses a lightweight router to select the depth-1 subtree.
  • De analogie: Een slimme gids (de Router) bekijkt het terrein dat je hebt verkend. Misschien leidt Pad A naar een klif, Pad B naar een moeras, maar leidt Pad C naar een prachtige weide. De gids wijst naar Pad C en zegt: "Oké, laten we ons officieel aan dit pad committeren."

3. Het "Snoeien en Verschuiven" (Vooruitgaan)

De AI schrijft officieel de eerste stap van Pad C op. Het gooit de ideeën van Pad A en Pad B weg (snoeien/pruning). Vervolgens verplaatst het het startpunt naar het einde van die eerste stap en herhaalt het proces: weer vooruitkijken, de beste volgende stap kiezen en verder gaan.

  • De term uit het paper: Prune–shift–grow decoding process.
  • De analogie: Je zet de eerste stap op het pad naar de weide. Nu ben je op een nieuwe plek. Je kijkt weer vooruit, kiest de volgende beste stap en blijft wandelen.

Waarom is dit beter dan andere methoden?

Het paper vergelijkt dit met twee andere veelvoorkomende manieren waarop AI denkt:

  • Vs. "Discrete Chain-of-Thought" (De "Eén-Pad" Wandelaar):

    • Het Probleem: De "Eén-Pad" Wandelaar moet beslissen welke kant hij op gaat voordat hij ziet hoe het pad eruitziet. Het is alsof je een deur kiest zonder hem te openen.
    • Het LBR-voordeel: LBR opent de deur (loopt het pad) voordat het een beslissing neemt. Het paper laat zien dat de "hidden states" (het mentale beeld van het pad) na het lopen van een paar stappen waardevolle aanwijzingen bevatten die helpen een betere beslissing te nemen.
  • Vs. "Soft-Token Branching" (De "Wazige Mix"):

    • Het Probleem: Sommige methoden proberen naar alle paden tegelijk te kijken door ze samen te smelten tot een "wazig" gemiddelde. Het is alsof je naar een foto kijkt waarbij alle drie de paden over elkaar heen zijn geplaatst. Je kunt de details van geen enkel pad duidelijk zien.
    • Het LBR-voordeel: LBR houdt de paden discreet (apart en duidelijk). Het loopt Pad A, dan Pad B, dan Pad C, en vergelijkt ze duidelijk met elkaar. Het paper vond dat het apart houden van de paden de AI in staat stelt om specifieke details (zoals een klif of een weide) te zien die verloren gaan in de "wazige" mix.

De Resultaten: Wat hebben ze gevonden?

De auteurs hebben dit getest op twee soorten taken:

  1. Synthetische Planning (Een bedacht spel): Ze creëerden een puzzel waarbij de AI door een graaf moest navigeren. Ze ontdekten dat LBR veel beter was in het oplossen hiervan omdat het de "aanwijzingen" die gevonden werden door de korte paden te bewandelen, kon gebruiken om de juiste afslag te nemen.
  2. Wiskundig Redeneren (Echte wiskundeproblemen): Ze testten LBR op moeilijke wiskundige benchmarks (zoals gebruikt in wedstrijden).
    • Het Resultaat: LBR loste meer problemen correct op dan de standaard "Eén-Pad" methode en de "Wazige Mix" methode.
    • Efficiëntie: Dit deed het zonder dat het nodig was om elke mogelijke oplossing in het universum te controleren. Het controleerde slechts een paar lokale opties, maakte een slimme keuze en ging verder.

De Kernboodschap

Local Branch Routing is als het geven van een "zaklamp" aan een AI, waardoor het een paar stappen vooruit kan kijken voordat het een beslissing neemt. Het probeert niet de hele toekomst te zien (wat te duur is), maar het gokt ook niet blindelings. Door naar een paar korte mogelijkheden te kijken, deze duidelijk te vergelijken en de beste te kiezen, wordt de AI slimmer en nauwkeuriger bij het oplossen van complexe redeneerproblemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →