Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
Dit artikel introduceert Pion, een hoogdoorlaat spectrale optimizer die Muon verbetert door ruisachtige gradiëntcomponenten te onderdrukken en per-head specialisatie te behouden, waardoor superieure prestaties en stabiliteit worden bereikt in visie-taal-actie training en versterkingsleren met verifieerbare beloningen waar Muon en AdamW tekortschieten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Een Nieuwe Optimizer voor Robots en Redenering
Stel je voor dat het trainen van een AI lijkt op het onderwijzen van een student. Lange tijd was AdamW de beste leraar (optimizer) voor grote taalmodellen (LLMs). Onlangs kwam er een nieuwe, geavanceerdere leraar bij genaamd Muon. Muon is uitstekend in de "pretraining"-fase—waarbij de AI het hele internet leest om algemene kennis te verwerven. Muon werkt door het brein van de AI te behandelen als een muzikaal instrument, waarbij ervoor wordt gezorgd dat elke noot (wiskundige richting) met even groot volume wordt gespeeld om moedige exploratie te stimuleren.
Echter, de auteurs van dit paper ontdekten dat Muon een groot gebrek heeft wanneer je het probeert te gebruiken voor twee specifieke, geavanceerde taken:
- Robots Onderwijzen (VLA): Het omzetten van een slim taalmodel in een robot die kan zien, praten en bewegen.
- Wiskunde/Logica Onderwijzen (RLVR): Het gebruik van beloningen om een AI te leren moeilijke problemen op te lossen, zoals wiskundepuzzels.
In deze nieuwe scenario's faalt Muon vaak, waardoor de robot onhandig beweegt of de wiskundige oplossing alles wat het heeft geleerd vergeet. De auteurs stellen een nieuwe leraar voor genaamd Pion die deze problemen oplost.
Het Probleem: Waarom Muon Faalt in Nieuwe Situaties
Om het probleem te begrijpen, stel je het leerproces van de AI voor als een geluidssysteem met veel luidsprekers (wiskundige richtingen).
1. Het Robotprobleem (Het "Low-Rank" Probleem)
Bij het trainen van een robot is het deel van het brein dat de armen aanstuurt (de "actie-module") zeer eenvoudig. Het hoeft alleen maar in een paar specifieke richtingen te bewegen.
- De Analogie: Stel je een koor voor waarbij slechts 3 zangers de juiste tekst hebben, maar 97 gewoon willekeurige geluiden neuriën.
- Wat Muon doet: Muon is als een geluidsingenieur die het volume van elke zanger exact op hetzelfde niveau zet. Het maakt de 3 goede zangers luid, maar blaast ook de 97 lawaaierige zangers op tot hetzelfde volume. Het resultaat? De robot raakt in de war door het lawaai en beweegt onregelmatig.
- De Oplossing: Je hebt een systeem nodig dat de goede zangers luid houdt maar de lawaaierige dempt.
2. Het Wiskundeprobleem (Het "Low Signal-to-Noise" Probleem)
Wanneer je een AI leert wiskundeproblemen op te lossen met behulp van beloningen (RLVR), is de feedback zeer "ruisachtig". De AI raadt, krijgt een beloning en probeert het opnieuw. Het signaal (de daadwerkelijke wiskundeleer) is zwak, en de ruis (willekeurig gissen) is sterk.
- De Analogie: Stel je voor dat je probeert een fluistering te horen in een orkaan.
- Wat Muon doet: Muon probeert de fluistering en de orkaanswind even luid te maken. Dit overspoelt de fluistering volledig, waardoor de AI "instort" en stopt met leren.
- De Oplossing: Je hebt een filter nodig dat de fluistering versterkt maar de orkaanswind blokkeert.
De Oplossing: Pion Doet zijn Intrede
De auteurs hebben Pion ontwikkeld (sPectral hIgh-pass Optimization on momeNtum). Denk aan Pion als een slimme audio-equalizer die Muon vergeten was toe te voegen.
In plaats van alle volumes gelijk op te draaien, gebruikt Pion een tweestapsproces:
- Promotie: Het versterkt de belangrijke, duidelijke signalen (het "hoofd" van het geluid).
- Onderdrukking: Het dempt actief de lawaaierige, zwakke signalen (de "staart" van het geluid).
Dit wordt een "High-Pass" filter genoemd. Net zoals een high-pass filter in muziek de lage, grommende basruis weghaalt om de duidelijke zang te laten schitteren, snijdt Pion de wiskundige ruis weg om de nuttige leerrichtingen te laten schitteren.
Belangrijkste Kenmerken van Pion:
- Plug-and-Play Vervanging: Het past precies in de bestaande trainingscode waar Muon ook gaat. Het vereist geen extra computerkracht of tijd; het is net zo snel.
- Per-Head Modus: Voor de wiskundeproblemen kan Pion verschillende delen van het AI-brein (zogenaamde "attention heads") individueel behandelen. Het is alsof je beseft dat sommige studenten in een klas goed zijn in meetkunde terwijl anderen goed zijn in algebra, en je hen verschillende huiswerkopdrachten geeft, in plaats van de hele klas als één grote klomp te behandelen.
De Resultaten: Robots en Wiskunde Worden Slimmer
Het paper testte Pion op twee hoofdgebieden:
1. Echte Robots (VLA)
- De Test: Ze trainden robots om objecten (zoals komkommers of kubussen) op te pakken en in kommen of borden te plaatsen.
- Het Resultaat:
- AdamW: De robot had moeite, liet vaak dingen vallen of miste het doel.
- Muon: De robot deed het beter, maar was nog steeds onrustig en botste soms tegen dingen aan omdat het "luisterde" naar te veel ruis.
- Pion: De robot was soepel en precies. In één test behaalde Pion een 100% slagingspercentage na 1.500 stappen, terwijl Muon slechts 97% haalde en AdamW slechts 32%.
- Realiteit: Ze testten dit zelfs op een echte fysieke robotarm (Franka Research 3), en Pion won opnieuw, waarbij het objecten veel betrouwbaarder oppakte en plaatste dan de anderen.
2. Wiskundige Redenering (RLVR)
- De Test: Ze leerden AI-modellen (Qwen3) wiskundeproblemen op te lossen (MATH en GSM8K datasets) met behulp van versterkend leren.
- Het Resultaat:
- Muon: Het model stortte in. De nauwkeurigheid daalde tot bijna nul omdat de ruis het leersignaal overspoelde.
- AdamW: Het model leerde langzaam maar gestaag.
- Pion: Het model leerde sneller en behaalde een hogere nauwkeurigheid dan AdamW, waarbij het het lawaaierige wiskundige milieu succesvol doorkruiste.
Samenvatting
Het paper betoogt dat Muon, hoewel het een fantastisch hulpmiddel is voor de initiële "leesfase" van AI-training, te "luid" en indiscriminatie is voor de delicate taken van het besturen van robots of het oplossen van wiskundeproblemen. Pion is het nieuwe hulpmiddel dat werkt als een noise-canceling koptelefoon voor AI-training: het houdt de belangrijke leersignalen helder en luid terwijl het de afleidende ruis dempt, wat leidt tot slimmere robots en betere wiskundige oplossers zonder iets te vertragen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.