← Nieuwste papers
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

Deze studie toont aan dat RL-getrainde Lean-theoremaproofs last hebben van mode collapse tijdens de inferentie, wat effectief kan worden verzacht door een vast schema van diverse tactiekskeletten toe te passen om aanzienlijke prestatiewinst te behalen, terwijl parafraseren van prompts en irrelevante opmerkingen inefficiënt of schadelijk blijken.

Oorspronkelijke auteurs: Zachary Burton

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zachary Burton

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een briljante student voor die is getraind om zeer moeilijke wiskundepuzzels op te lossen met een speciale programmeertaal die Lean heet. Deze student, laten we hen "DeepSeek" noemen, is ongelooflijk slim maar heeft een vreemde gewoonte: wanneer ze wordt gevraagd een puzzel op te lossen, raakt ze vast in een mentaal patroon.

Dit artikel is een diagnoseverslag over waarom dit gebeurt en hoe het opgelost kan worden. Hier is het verhaal van wat de onderzoekers hebben gevonden, verteld in alledaagse termen.

1. Het Probleem: Het "Gebroken Plaatje"-Effect

De onderzoekers merkten op dat wanneer ze DeepSeek vroegen om dezelfde wiskundepuzzel keer op keer op te lossen (alleen met lichtjes verschillende willekeurige zaden, zoals het rollen van dobbelstenen), de student bleef proberen exact dezelfde eerste stap te zetten.

  • De Analogie: Stel je voor dat je probeert een afgesloten deur te openen. Je probeert de sleutel in het slot. Het werkt niet. Je probeert het opnieuw. Het werkt nog steeds niet. Je probeert het een derde keer, en een honderdste keer. Zelfs als je het 64 keer probeert, stop je gewoon dezelfde sleutel op dezelfde manier in hetzelfde slot. Je verkent geen andere sleutels of andere manieren om de deur open te maken.
  • Het Resultaat: In de studie verdubbelde het aantal pogingen van 32 naar 64 niet één enkel nieuw puzzel op. De student had "mode collapse" ondergaan – ze zat vast op een smalle weg en kon niets anders bedenken.

2. De Oplossing: Een "Eerste Stap"-Hint Geven

De onderzoekers realiseerden zich dat de student niet lui was; ze was gewoon te vastgezet in haar routine. Dus probeerden ze een nieuwe truc: voordat ze de student vroegen de puzzel op te lossen, gaven ze hen een specifieke instructie over hoe ze moesten beginnen.

  • De Analogie: In plaats van gewoon te zeggen: "Los deze puzzel op," zeiden de onderzoekers: "Begin met het vereenvoudigen van de getallen," of "Begin met het introduceren van een nieuwe variabele." Het is alsof je de student een specifieke sleutel geeft om eerst te proberen, in plaats van ze te laten gokken.
  • Het Resultaat: Deze simpele duw brak het patroon. De student begon plotseling veel meer puzzels op te lossen. Het "patroon" was niet omdat de student slecht was in wiskunde; het was omdat ze te stijf was in hoe ze begon.

3. Het "Waarom": Het Is een Trainingsprobleem, Geen Hersenprobleem

De onderzoekers wilden weten: Is de student van nature slecht in wiskunde, of heeft de training ze stijf gemaakt?

  • Het Experiment: Ze testten de student voordat ze de speciale wiskundetraining kreeg (het "Base"-model).
  • De Bevinding: De ongetrainde student kon helemaal geen puzzels oplossen. Ze gaf gewoon op of herhaalde de vraag.
  • De Conclusie: De speciale training (Versterkende Leer) is wat de student in de eerste plaats heeft geleerd puzzels op te lossen. Maar diezelfde training is ook wat ze stijf en vastgezet in een patroon heeft gemaakt. De training creëerde de vaardigheid, maar creëerde ook het "gebroken plaatje"-probleem.

4. Wie Heeft Nog Meer Dit Probleem?

De onderzoekers testten andere "studenten" (verschillende AI-modellen) om te zien of dit een universeel probleem was.

  • De "SFT"-Student: Een student was anders getraind (Supervised Fine-Tuning). Deze student was in het algemeen beter in het oplossen van puzzels, maar had het "patroon"-probleem niet. Toen de onderzoekers hen hints gaven, werd het zelfs iets slechter. Ze waren al flexibel genoeg om hun eigen weg te vinden.
  • De "RL"-Studenten: De studenten die waren getraind met de speciale "Versterkende Leer"-methode (zoals DeepSeek) waren degene die vastzaten. Ze hadden de "eerste stap"-hints nodig om uit hun smalle denken te komen.

5. Het Bewijs van de "Eerste Move"

Om te bewijzen dat dit niet zomaar een toevalstreffer was, keken de onderzoekers naar de daadwerkelijke "eerste moves" die de studenten maakten.

  • De Bevinding: Van de 64 pogingen op een enkele puzzel gebruikte de "patroon-achtige" student in bijna de helft van de gevallen exact dezelfde eerste zet. Ze waren ongelooflijk voorspelbaar.
  • De Metafoor: Als je een mens zou vragen 64 keer een verhaal te schrijven, zouden ze misschien beginnen met "Er was eens", "De zon scheen" of "Het was een donkere nacht". Maar deze AI-student zou 32 keer beginnen met "Er was eens" en 30 keer met "De zon scheen". Ze hadden bijna geen variatie in hun openingszin.

Samenvatting

Het artikel concludeert dat Versterkende Leer (een specifieke manier om AI te trainen) een tweesnijdend zwaard creëert:

  1. Het leert de AI hoe ze formele wiskundebewijzen moet oplossen (wat ze daarvoor niet kon).
  2. Maar het maakt de AI ook zo gefocust op een paar "winnende" strategieën dat ze stopt met het verkennen van nieuwe.

De oplossing is niet om de AI meer rekenkracht of meer tijd om na te denken te geven; het is om haar structurele begeleiding te geven – een simpele duw over hoe ze het bewijs moet beginnen. Dit dwingt de AI om haar routine te doorbreken en nieuwe paden te verkennen, waardoor oplossingen worden ontsloten die ze eerder te koppig was om te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →