← Nieuwste papers
🤖 machine learning

Mirror Horizon: Viable Path Entropy as a Measure of Bounded Reflection

Dit artikel introduceert de Mirror Theory en haar operationele maatstaf, Viable Path Entropy (VPE), om intelligente capaciteit te definiëren als de structuur van geverifieerde, diverse voortzettingen die bereikbaar zijn onder begrensde reflectie, waarbij via experimenten met taalmodellen wordt aangetoond dat deze metriek de toegankelijke redeneercapaciteit effectiever vastlegt dan het aantal parameters of one-shot nauwkeurigheid.

Oorspronkelijke auteurs: Tiantian Zhang (Crystal)

Gepubliceerd 2026-07-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tiantian Zhang (Crystal)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische spiegel hebt die niet alleen je gezicht laat zien, maar ook elke mogelijke versie van je toekomstige zelf toont die zou kunnen bestaan als je zou blijven praten, denken of een probleem zou oplossen. De meeste mensen kijken in een spiegel en vragen: "Heb ik het antwoord goed?" Dit paper stelt een veel interessantere vraag: "Hoeveel verschillende goede antwoorden kan deze spiegel vinden, en hoeveel van die antwoorden overleven de test?"

De auteurs noemen dit idee Mirror Theory (Spiegentheorie). In plaats van een AI te behandelen als een statische encyclopedie die feiten opslaat, behandelen ze het als een levende spiegel die een proces genaamd "reflectie" moet overleven. Denk bij reflectie niet aan een enkele lichtflits, maar aan een lang, kronkelend pad waarbij de AI veel verschillende manieren probeert om een probleem op te lossen.

De belangrijkste ontdekking: Groter is niet altijd beter

De grootste verrassing van het paper is dat groter niet altijd beter is. In de wereld van AI gaan we er meestal vanuit dat een model met meer "hersencapaciteit" (parameters) automatisch superieur is. Maar de auteurs testten dit met een specifieke opstelling: ze vroegen drie verschillende versies van een AI (genaamd Qwen2.5) om 30 wiskundeproblemen op te lossen. Ze gaven ze een beperkte hoeveelheid "denktijd" (gemeten in tokens, wat vergelijkbaar zijn met woordfragmenten).

Dit is wat ze vonden:

  • Wanneer ze de modellen een korte denktijd gaven (96 tokens), hadden de kleinere modellen moeite.
  • Toen ze de denktijd verhoogden naar 160 tokens, gebeurde er iets cools. Het 1,5 miljard-parameter model (het middelgrote model) werd de kampioen. Het vond meer correcte antwoorden, en belangrijker nog, het vond ze op meer verschillende manieren dan de anderen.
  • Het 3-miljard-parameter model (het grootste model) deed het in deze specifieke test zelfs slechter dan het middelgrote model. Het kreeg sommige antwoorden goed, maar het zat vast in een sleur en vond steeds dezelfde paar oplossingen, terwijl het middelgrote model een breder scala aan succesvolle paden verkende.

Het paper suggereert dat "capaciteit" niet alleen gaat over hoe groot het model is; het gaat erom hoeveel haalbare paden (correcte, diverse oplossingen) het daadwerkelijk kan bereiken binnen een beperkt budget van tijd en energie.

De "Viable Path Entropy" Scorekaart

Om dit te meten, hebben de auteurs een nieuwe score uitgevonden genaamd Viable Path Entropy (VPE). Stel je voor dat je een jurylid bent bij een talentenjacht.

  • Oude manier (Pass@k): Je controleert alleen of minstens één deelnemer een perfect score heeft behaald. Zo ja, dan geef je ze een gouden ster. Zo nee, dan krijgen ze niets.
  • Nieuwe manier (VPE): Je controleert twee dingen:
    1. Bereikbaarheid: Hebben ze überhaupt een correcte oplossing gevonden?
    2. Diversiteit: Als dat zo is, hoeveel verschillende soorten correcte oplossingen hebben ze gevonden? Hebben ze het opgelost met een slimme shortcut, een lange berekening en een visueel diagram? Of hebben ze gewoon drie keer hetzelfde antwoord geraden?

Het paper laat zien dat het middelgrote model (1,5B) de hoogste VPE-score had. Het kreeg niet alleen meer antwoorden goed, maar het deed dat op meer creatieve, onderscheidende manieren. Het grootste model (3B) had een lagere score omdat het, hoewel het slim was, onder deze specifieke regels minder "verkennend" was.

Wat dit paper uitsluit

De auteurs zijn zeer duidelijk over wat dit niet is.

  • Het is geen regel die zegt: "Grotere modellen winnen altijd." Het experiment laat expliciet zien dat een groter model een kleinere "spiegelhorizon" (minder toegankelijk succes) kan hebben dan een kleiner model als de omstandigheden niet goed zijn.
  • Het is geen magische formule die precies voorspelt hoe AI voor altijd zal schalen. De auteurs stellen dat er geen enkele, eenvoudige lijn is die zegt: "meer parameters = meer capaciteit." In plaats daarvan hangt capaciteit af van de specifieke regels van het spel (de prompt, de tijdslimiet, de verifieerder).
  • Het is niet alleen maar belangrijk om één keer het juiste antwoord te krijgen. Het paper betoogt dat het minder indrukwekkend is om het juiste antwoord op slechts één rigide manier te vinden, dan om vele verschillende geldige wegen naar dat doel te vinden.

Hoe zeker zijn ze?

De auteurs zijn voorzichtig om niet te beweren dat ze het mysterie van AI voor altijd hebben opgelost. Ze beschrijven hun resultaten als gemeten en geobserveerd in een specifiek experiment, niet als een universele wet van de natuur.

  • Ze voerden 32 steekproeven (pogingen) uit voor elk van de 30 wiskundeproblemen.
  • Ze gebruikten een specifieke "verifieerder" (een strikte controleur die naar het juiste getal kijkt) en een specifieke "mode map" (een manier om vergelijkbare oplossingen te groeperen).
  • Ze geven toe dat hun "mode map" een beetje grof is (zoals oplossingen groeperen op basis van lengte of eenvoudige wiskundige symbolen) en dat toekomstige tests complexere manieren kunnen gebruiken om antwoorden te groeperen.
  • Ze suggereren dat hun bevindingen de ondersteuning bieden voor de idee van Mirror Theory, maar ze beweren niet dat ze het onomstotelijk bewezen hebben. Ze zeggen dat hun resultaten "laten zien dat" de maatstaf werkt en "de claim ondersteunen", maar ze laten de deur open voor meer testen met verschillende taken en modellen.

De kernboodschap

Beschouw de AI niet als een robot die een tekstboek uit het hoofd leert, maar als een ontdekkingsreiziger met een beperkte voorraad brandstof. Het paper suggereert dat de beste ontdekkingsreiziger niet noodzakelijkerwijs de grootste is; het is degene die zijn brandstof kan gebruiken om de meest onderscheidende, correcte paden door het bos te vinden. Wanneer je de ontdekkingsreiziger meer brandstof geeft (het verhogen van het tokenbudget van 96 naar 160), wordt de middelgrote ontdekkingsreiziger plotseling de meest capabele, waarbij hij een rijke variëteit aan oplossingen vindt die de grotere, zwaardere ontdekkingsreiziger miste.

Het paper concludeert dat om de intelligentie van een AI echt te begrijpen, we niet alleen moeten vragen: "Heeft het het antwoord gevonden?" We moeten vragen: "Hoeveel verschillende, geldige manieren had het kunnen vinden om het antwoord te vinden, en hoeveel van die manieren heeft het daadwerkelijk ontdekt?" Dat is de nieuwe "spiegelhorizon".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →