← Nieuwste papers
🤖 machine learning

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Dit artikel introduceert Mat-Pref, een benchmark met verifieerbare beloningen voor anorganische materialen, en demonstreert dat een tweestaps trainingspipeline die supervised fine-tuning combineert met Group Relative Policy Optimization (GRPO) aanzienlijk beter presteert dan grotere zero-shot modellen door het verbeteren van compositionele redenering en generalisatie naar onbekende structuurfamilies en eigenschappen.

Oorspronkelijke auteurs: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar onervaren chef probeert te leren hoe hij een perfect maaltijd kookt. Je hebt een enorme bibliotheek met recepten (de trainingsdata), maar de chef blijft de verkeerde ingrediënten raden of raakt de weg kwijt in de instructies.

Dit artikel, MAT-PREF, gaat over het leren van een specif type "chef" (een Kunstmatige Intelligentie) hoe hij complexe puzzels moet oplossen die te maken hebben met anorganische materialen—denk aan de bouwstenen voor nieuwe batterijen, zonnepanelen of computerchips.

Hier is het verhaal van wat ze hebben gedaan, eenvoudig uitgelegd:

1. Het Probleem: De Chef Kan Niet "Redeneren", Hij Raadt Alleen Maar

De onderzoekers wilden zien of grote AI-modellen konden uitzoeken wat de beste manier is om één ingrediënt (een atoom) in een kristalstructuur te vervangen door een ander om het sterker of efficiënter te maken.

Ze testten vier van de slimste AI-chefs ter wereld (modellen met 70 tot 671 miljard "hersencellen"). Ondanks dat deze modellen enorm zijn, kregen ze slechts ongeveer 33% tot 54% van de antwoorden goed.

  • De Analogie: Het is alsof je een genie een meerkeuze-wiskundetoets geeft, maar hij blijft het verkeerde antwoord kiezen omdat hij alleen maar gokt op basis van hoe de woorden eruitzien, in plaats van daadwerkelijk de wiskunde te doen. Hij heeft de logica van de chemie nog niet geleerd.

2. De Oplossing: Een Nieuwe "Trainingsgym" (MAT-PREF)

Om dit op te lossen, bouwde het team een nieuwe trainingsgrond genaamd MAT-PREF.

  • De Bron: Ze gebruikten een enorme, betrouwbare database van chemische feiten (Materials Project) waar elk antwoord is geverifieerd door een supernauwkeurige computersimulatie (genoemd DFT). Het is alsof je een leraar hebt die het exacte juiste antwoord weet voor elke vraag.
  • De Test: Ze creëerden meer dan 10.000 vragen. Sommige waren makkelijk (vergelijkbaar met wat de AI in de training zag), sommige waren moeilijk (totaal nieuwe kristalvormen), en sommige waren verraderlijk (hetzelfde gebruik van vormen, maar vroeg over een andere eigenschap, zoals "hoeveel licht het blokkeert" in plaats van "hoe stabiel het is").

3. De Trainingsmethode: Twee Stappen naar Succes

De onderzoekers gaven de AI niet alleen meer data. Ze gebruikten een tweetraps trainingsproces:

  • Stap 1: Supervised Fine-Tuning (SFT) – "De Regels Leren"
    Eerst leerden ze de AI om te denken als een chemicus. Ze gaven het de AI voorbeelden van vragen en de juiste redeneerstappen (bijv. "Controleer de grootte van het atoom," "Contoleer de elektrische lading").

    • Resultaat: De AI werd veel beter in het volgen van het format en het begrijpen van de logica, waarbij het sprong maakte van bijna willekeurig gokken naar een nauwkeurigheid van ongeveer 45%. Maar het was nog steeds inconsistent.
  • Stap 2: GRPO (Group Relative Policy Optimization) – "Leren van Fouten"
    Dit is het geheime ingrediënt. Stel je voor dat de AI probeert een vraag 8 keer te beantwoorden.

    • Als het antwoord goed is, krijgt het een "beloning" (een traktatie).
    • Als het fout is, krijgt het een "nee".
    • De AI vergelijkt vervolgens zijn 8 pogingen. Het leert: "Hé, het antwoord dat ik bij poging #3 koos was goed, maar dat van poging #7 was fout. Ik moet stoppen met het kiezen van #7."
    • Resultaat: Dit proces dwingt de AI om te stoppen met gokken en te beginnen met het vastleggen van de juiste logica.

4. De Resultaten: Een Kleine Chef Verslaat de Reuzen

Na deze tweetraps training namen ze een relatief klein AI-model (Qwen3-8B) en testten dit opnieuw.

  • De Schok: Dit kleine, getrainde model behaalde een nauwkeurigheid van 65% tot 71%.
  • De Vergelijking: Het versloeg de enorme, ongetrainde "reuzen" (die 30 keer meer hersenkracht hadden) met een enorme marge (meer dan 20 procentpunt).
  • De Kosten: Ze deden al deze training voor minder dan $50.

5. Waarom Het Ertoe Doet: Consistentie is de Sleutel

De onderzoekers ontdekten iets fascinerends over hoe de AI verbeterde.

  • Vóór: De AI wist soms het juiste antwoord, maar het was als een nerveuze student die het antwoord wist maar bang was om zijn hand op te steken. Als je dezelfde vraag met een iets andere bewoording stelde (afleiders), wisselde de AI tussen goed en fout.
  • Ná: De training maakte de AI zelfverzekerd. Het vond niet alleen het juiste antwoord; het leerde om er ook bij te blijven.
    • De Analogie: Denk aan een student die een toets maakt. Voorheen zou hij op de ene versie van de vraag misschien "A" invullen en op een andere versie "B", zelfs als de logica hetzelfde is. Na de training vult hij elke keer "A" in, omdat hij het concept echt begrijpt.

Samenvatting

Dit artikel laat zien dat grootte niet alles is. Je hebt niet de grootste, duurste AI nodig om complexe wetenschappelijke problemen op te lossen. In plaats daarvan heb je een slimme trainingsmethode nodig die geverifieerde feiten gebruikt om de AI te leren hoe hij logisch en zelfverzekerd moet redeneren. Door deze nieuwe "gym" (MAT-PREF) en de tweetraps training te gebruiken, leerde een kleine AI de reuzen te overtreffen bij het uitzoeken hoe je betere materialen bouwt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →