Generalizing the Geometry of Model Merging Through Frechet Averages
Dit artikel stelt een algemeen raamwerk voor modelmerging voor op basis van Fréchet-gemiddelden over geschikte variëteiten om symmetrie-invariantie te waarborgen, waarbij wordt aangetoond dat het bestaande methoden zoals Fisher-merging omvat en een praktisch algoritme biedt voor het samenvoegen van low-rank adapters (LoRA) dat de beperkingen van huidige benaderingen aanpakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een team van expert-koks voor. Elke kok heeft een specifiek gerecht onder de knie: de ene maakt de perfecte lasagne, de ander de ideale sushi, en een derde de fijnste soufflé. Nu wil je een "Superkok" creëren die alle drie de gerechten perfect kan bereiden, maar je hebt geen tijd om een nieuwe kok vanaf nul op te leiden. Je wilt gewoon de kennis van de bestaande koks combineren.
In de wereld van AI heet dit Model Merging. Je neemt de "weights" (de interne instellingen) van verschillende AI-modellen en probeert ze in één te mengen.
Het Probleem: De "Verkeerde Kaart"
Het artikel stelt dat de oude manier om dit te doen, vergelijkbaar is met het proberen om de recepten van deze koks te mengen door simpelweg hun aantallen op een stuk papier te middelen. Dit werkt prima als iedereen in dezelfde taal schrijft en dezelfde eenheden gebruikt.
Maar AI-modellen hebben een verborgen eigenaardigheid: Symmetrie.
Stel je dit voor: Kok A schrijft "2 koppen bloem", terwijl Kok B schrijft "1 kop bloem + 1 kop bloem". Ze bedoelen precies hetzelfde, maar de aantallen zien er anders uit. Of, Kok C heeft de volgorde van de ingrediënten in zijn notitieboekje verwisseld, maar de smaak van het gerecht is identiek.
In AI zijn er veel manieren om exact hetzelfde "recept" (model) op te schrijven met verschillende aantallen. Als je gewoon het gemiddelde van de aantallen neemt (Naive Averaging), kun je eindigen met een recept dat zegt "0 koppen bloem" omdat de positieve en negatieve aantallen elkaar hebben opgeheven. Je hebt dan een gebroken model gecreëerd dat niets kan bereiden.
De auteurs noemen dit het verlaten van de baan. Stel je voor dat het "ware" recept op een cirkelvormige baan ligt (een orbit). Als je gewoon een rechte lijn trekt tussen twee punten op de baan, snijd je dwars door het midden van de cirkel en beland je in de modder (een gebroken model), in plaats van op de baan te blijven waar de goede recepten wonen.
De Oplossing: De "Slimme Kompas" (GeoMerge)
Het artikel stelt een nieuwe methode voor genaamd GeoMerge. In plaats van alleen aantallen te middelen, behandelen ze de ruimte van AI-modellen als een gebogen landschap (een Riemanniaanse variëteit).
- De Kaart: Ze beseffen dat, vanwege de symmetrie (de verschillende manieren om hetzelfde recept op te schrijven), de "ware" kaart geen plat vel papier is. Het is een gevouwen, gebogen oppervlak waar verschillende punten eigenlijk hetzelfde voorstellen.
- Het Kompas: Ze gebruiken een wiskundig hulpmiddel genaamd een Fréchet-gemiddelde. Denk hierbij niet aan een simpel gemiddelde, maar aan het vinden van het "zwaartepunt" op een gebogen oppervlak.
- Uitlijning: Voordat ze de modellen mengen, "alignen" ze ze eerst. Het is alsof ze ervoor zorgen dat Kok A en Kok B beide dezelfde meetbekers gebruiken en in dezelfde volgorde schrijven. Ze vinden de specifieke versie van het recept van elke kok die het dichtst bij de anderen ligt, en negeren de cosmetische verschillen in hoe de aantallen zijn opgeschreven.
- Het Pad: In plaats van recht door de modder te snijden, lopen ze langs het gebogen pad (een geodeet) dat op de baan van "goede recepten" blijft.
Waarom Dit Belangrijk Is voor "LoRA" (De Gespecialiseerde Koks)
Het artikel richt zich sterk op een populaire techniek genaamd LoRA (Low-Rank Adaptation). Stel je voor dat dit geen volledige koks zijn, maar gespecialiseerde sous-koks die slechts een paar specifieke ingrediënten aanpassen om een gerecht te verbeteren.
De auteurs ontdekten dat wanneer je probeert deze gespecialiseerde aanpassingen te mergen met oude methoden, het "symmetrie"-probleem nog erger is. De notities van de sous-koks zijn zo flexibel dat ze op duizenden verschillende manieren kunnen worden opgeschreven die allemaal hetzelfde betekenen.
- Oude Methode (KnOTS): Probeert de notities uit te lijnen met een stijve, stap-voor-stap wiskundige truc (SVD). Het werkt redelijk, maar het is alsof je probeert vierkante pennen in ronde gaten te forceren.
- GeoMerge: Erkent dat de notities natuurlijk op een gebogen oppervlak leven. Het gebruikt de "Slimme Kompas" om het ware centrum van de groep te vinden zonder ze in een stijve vorm te forceren.
De Resultaten
De onderzoekers testten dit op een groot AI-model (Llama 3) dat was gespecialiseerd voor verschillende soorten taalpuzzels (Natural Language Inference).
- De Uitkomst: GeoMerge creëerde een "Superkok" die beter presteerde dan de vorige beste methode (KnOTS).
- De Efficiëntie: Nog beter, GeoMerge deed dit terwijl het de "grootte" van het recept klein hield. De oude methode eindigde met een enorm, opgeblazen recept (hoge rang), terwijl GeoMerge het slank en efficiënt hield, wat bewees dat het de geometrie van het probleem beter begreep.
In Het Kort
Het artikel zegt: Middelen niet zomaar de aantallen. AI-modellen zijn als recepten die in veel verschillende talen kunnen worden geschreven. Als je ze wilt samenvoegen, moet je ze eerst vertalen naar een gemeenschappelijke taal (uitlijning) en vervolgens het centrum van de groep vinden met een kaart die de vorm van de wereld respecteert (geometrie), in plaats van een platte liniaal. Dit voorkomt dat de "Superkok" een gebroken puinhoop wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.