← Nieuwste papers
💬 NLP

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

Dit artikel introduceert RAD (Routing Agreement Decoding), een nieuwe inferentiestrategie die de onderscheidende Mixture-of-Experts routeringspatronen van identieke tokens benut om hoogwaardige redeneertrajecten te selecteren zonder afhankelijk te zijn van het parsen van antwoordstrings of stemmen, waardoor effectieve pass@1 selectie mogelijk wordt voor code- en agentische taken waarbij traditionele meerderheidsstemming faalt.

Oorspronkelijke auteurs: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Is een "Hallo" Altijd Dezelfde "Hallo"?

Stel je voor dat je luistert naar een koor van 100 verschillende zangers (de "Experts" binnen een groot AI-model). Wanneer het koor het woord "Hallo" zingt, ga je er misschien vanuit dat ze het allemaal op exact dezelfde manier doen, met dezelfde vocale technieken en emoties.

De paper vraagt: Als de AI exact hetzelfde woord (token) produceert in twee verschillende situaties, betekent dit dan dat de interne "machinerie" die dat woord produceerde ook hetzelfde was?

Het Antwoord: Nee.

Zelfs als de AI exact hetzelfde woord schrijft (zoals "Hallo" of "Het antwoord is 42"), kan de specifieke groep "zangers" (experts) binnen het model die het woord produceerde, volledig verschillend zijn afhankelijk van de context. Eén "Hallo" kan gezongen worden door een groep experts die over wiskunde nadenken, terwijl een andere "Hallo" gezongen wordt door een groep die over programmeren nadenkt. Het woord is hetzelfde, maar de interne staat is anders.

Het Probleem: Hoe Kiezen We het Juiste Antwoord?

Normaal gesproken, wanneer we willen dat een AI een moeilijk probleem oplost (zoals een wiskundige puzzel of een programmeerfout), vragen we het om het 64 verschillende keren te proberen (64 "rollouts"). Daarna kijken we naar de uiteindelijke antwoorden. Als er 50 van hen "42" zeggen en 14 zeggen "43", dan kiezen we "42" omdat het de meerderheid is.

De Catch: Dit "stemmen op het uiteindelijke antwoord" werkt geweldig voor wiskunde (waar het antwoord een duidelijk getal is). Maar het loopt vast bij:

  1. Code: Twee programma's kunnen exact hetzelfde doen, maar er totaal anders uitzien (andere variabelen, andere opmaak). Je kunt niet simpelweg tellen hoe vaak het woord "print" voorkomt.
  2. Agents: Soms probeert de AI een softwarefout te herstellen. Het "antwoord" is een stukje code (een patch). Er is geen enkele "correcte string" om over te stemmen; de code is uniek voor elke poging.

We hebben een manier nodig om de beste poging te kiezen zonder de uiteindelijke antwoorden te lezen of te vergelijken.

De Oplossing: RAD (Routing Agreement Decoding)

De auteurs ontdekten een geheim signaal dat verborgen zit in de AI: De Router.

Beschouw de AI als een enorm kantoorgebouw met duizenden gespecialiseerde werknemers (experts). Voordat een werknemer aan een taak begint, beslist een Router (een manager) welke groep werkers de opdracht krijgt.

  • De Ontdekking: De paper vond dat wanneer de AI op het punt staat het begin van een antwoord te schrijven (zoals het symbool \boxed{ in wiskunde of de drievoudige backticks ``` in code), het beslissingspatroon van de Router veel onthult over de kwaliteit van het antwoord.
  • De Analogie: Stel je voor dat je probeert te raden welk team in een sporttoernooi gaat winnen. In plaats van te wachten op de einduitslag (die je nog niet kunt zien), kijk je naar welke spelers de coach heeft gekozen om de wedstrijd te beginnen.
    • Als de coach voor 50 verschillende wedstrijden dezelfde "dream team" opstelling kiest, is de kans groot dat die wedstrijden tot hetzelfde resultaat zullen leiden.
    • Als de coaches willekeurige, slecht samengestelde opstellingen kiezen, zullen de resultaten overal verspreid zijn.

RAD werkt als volgt:

  1. Het genereert 64 verschillende pogingen voor een probleem.
  2. Het negeert de uiteindelijke antwoorden volledig. Het leest ze niet.
  3. Het kijkt naar de Router's opstelling (welke experts werden gekozen) precies op het moment dat het antwoord begint.
  4. Het vraagt: "Welke 64 pogingen hadden de meest vergelijkbare opstellingen?"
  5. Het kiest de poging die bij de grootste groep vergelijkbare opstellingen hoort.

Als 50 pogingen allemaal dezelfde "expert-ploeg" gebruikten om hun antwoord te beginnen, neemt RAD aan dat deze groep het meest zelfverzekerd en waarschijnlijk correct is, zelfs zonder te weten wat het antwoord daadwerkelijk is.

Waarom Dit Belangrijk Is

  1. Het Werkt Waar Stemmen Faalt: Bij programmeertaken, waar je niet simpelweg woorden kunt tellen, werkt RAD nog steeds. Het kiest de beste code-patch door te kijken naar de "interne ploeg" die het schreef, niet naar de code zelf.
  2. Het Is Snel en Simpel: Het hoeft de betekenis van de code of de wiskunde niet te begrijpen. Het kijkt alleen naar het patroon van de interne "schakelaars" die worden omgezet.
  3. Het Is Geen Magische Waarheidsdetector: De paper is eerlijk over dit punt. Als 50 mensen allemaal het foute antwoord bevestigen (een "dense wrong basin"), zal RAD ook dat foute antwoord kiezen. Het kiest het meest populaire pad, niet noodzakelijkerwijs het ware pad. Het is een "consensus-signaal", geen "waarheidsverificator".

Samenvatting in Eén Zin

De paper laat zien dat zelfs als een AI twee keer hetzelfde woord zegt, de interne "ploeg" die het zei anders kan zijn; door het antwoord te kiezen dat voortkomt uit de meest consistente "ploegopstelling" aan het begin van de respons, kunnen we het beste resultaat kiezen zonder ooit het uiteindelijke antwoord te hoeven lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →