← Nieuwste papers
💻 computer science

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

Het artikel stelt DRIFT voor, een lichtgewicht fine-tuning-methode die redeneervermogens efficiënt overdraagt van alleen-tekst LLM's naar multimodale modellen door een vooraf berekende redeneerprior in de gradiëntruimte in te brengen, waarmee de instabiliteit van naïeve parameter-samenvoeging wordt overwonnen terwijl tegelijkertijd superieure prestaties worden bereikt met aanzienlijk lagere rekenkosten.

Oorspronkelijke auteurs: Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee zeer verschillende experts hebt:

  1. De Teksttovenaar: Een briljante wiskundige die complexe logische puzzels kan oplossen en stap-voor-stap oplossingen kan uitschrijven, maar in zijn hele leven nog nooit een afbeelding heeft gezien.
  2. De Visuele Kunstenaar: Een getalenteerde kunstenaar die een foto perfect kan beschrijven, objecten kan identificeren en grafieken kan begrijpen, maar moeite heeft met het oplossen van de wiskundeproblemen die in die afbeeldingen verborgen zitten.

Het doel van dit artikel is om de Visuele Kunstenaar te leren denken als de Teksttovenaar, zonder hen jarenlang terug naar school te sturen voor dure training.

Het Probleem: De "Slechte Huwelijk"-poging

Voorheen probeerden onderzoekers deze twee experts te combineren door hun hersenen (hun computergewichten) simpelweg te "samenvoegen". Ze dachten: "Als we 50% van het brein van de Wiskundetovenaar mixen met 50% van het brein van de Kunstenaar, krijgen we een perfecte Wiskunde-Kunstenaar."

Het artikel noemt dit naïef samenvoegen. De auteurs ontdekten dat dit meestal mislukt. Het is als proberen een straalmotor op een fiets te lijmen. Soms werkt het een beetje, maar vaak breekt het de fiets volledig. Het "Wiskunde"-gedeelte raakt in de war door het "Kunst"-gedeelte, en het "Kunst"-gedeelte vergeet hoe het moet zien. Het resultaat is een model dat slechter is in wiskunde én slechter in zien dan daarvoor.

De Oplossing: DRIFT (Het Kompas)

De auteurs stellen een nieuwe methode voor genaamd DRIFT (Directional Reasoning Injection for Fine-Tuning). In plaats van de twee hersenen fysiek aan elkaar te lijmen, gebruiken ze een kompas.

Zo werkt de analogie:

  1. Het Kaartleggen van het Verschil: Eerst kijken de onderzoekers naar het verschil tussen de Teksttovenaar en de Visuele Kunstenaar. Ze berekenen een "vector" (een richtingspijl) die precies wijst van "Hoe de Kunstenaar denkt" naar "Hoe de Tovenaar denkt". Deze pijl vertegenwoordigt de Redeneer-prioriteit.
  2. De Trainingsreis: Ze nemen de Visuele Kunstenaar en beginnen hen te onderwijzen met een kleine set afbeelding-wiskundeproblemen (slechts 4.000 voorbeelden, wat miniem is in vergelijking met de miljoenen die normaal nodig zijn).
  3. De Kompasgeleiding: Terwijl de Kunstenaar leert, berekent de computer de normale manier om het brein van de Kunstenaar bij te werken. Maar voordat de update wordt uitgevoerd, kijkt het naar het Kompas (de Redeneer-prioriteit). Het duwt de leerrichting van de Kunstenaar zachtjes in de richting van de denkwereld van de Tovenaar.
    • Het dwingt de Kunstenaar niet om de Tovenaar te worden.
    • Het zegt gewoon: "Hé, wanneer je dit oplost, probeer dan in deze specifieke richting te denken die de Tovenaar gebruikt."

Waarom Dit Een Grote Doorbraak Is

  • Snelheid: Traditionele methoden om een AI redeneervermogen bij te brengen vereisen enorme hoeveelheden data en duren dagen of weken aan supercomputertraining. DRIFT doet dit in ongeveer twee uur.
  • Efficiëntie: Het heeft geen enorme bibliotheek met afbeelding-wiskundeproblemen nodig. Het heeft alleen een kleine, hoogwaardige set nodig omdat het "Kompas" (de vooraf berekende richting) het meeste zware werk doet.
  • Veiligheid: In tegenstelling tot de "lijm"-methode, breekt DRIFT het vermogen van de Kunstenaar om te zien niet. Het artikel toont aan dat het model beter wordt in wiskunde zonder te vergeten hoe het afbeeldingen moet beschrijven.

Het Resultaat

Door dit "kompas" te gebruiken om de training te sturen, leert de Visuele Kunstenaar informatie logisch aan elkaar te rijgen, net als de Teksttovenaar. Het artikel bewijst dat deze methode beter werkt dan het proberen om de modellen aan elkaar te lijmen en veel sneller en goedkoper is dan training vanaf nul met enorme datasets.

Kortom: In plaats van twee verschillende hersenen te dwingen te versmelten tot één rommelige brij, stuurt DRIFT zachtjes één brein de juiste richting uit met behulp van een kaart die is gemaakt van de ander.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →