← Nieuwste papers
💻 computer science

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

Dit paper introduceert Align-TI, een nieuw kennisdistillatie-framework voor multimodale modellen dat de prestaties van kleinere modellen aanzienlijk verbetert door niet alleen op individuele tokens te focussen, maar ook op de dynamische interacties tussen visuele informatie en opeenvolgende teksttokens na te bootsen.

Oorspronkelijke auteurs: Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

Gepubliceerd 2026-02-11
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een meesterkok bent (het grote, slimme AI-model) die een gigantische keuken heeft vol met de nieuwste apparatuur, maar ook een enorme berg afwas en een leger aan assistenten nodig heeft om alles draaiende te houden. Je wilt nu een kleine, snelle leerling-kok (het kleine AI-model) opleiden die bijna net zo goed kan koken, maar die wel in een piepkleine keuken met maar één gaspitje kan werken.

Tot nu toe leerden we die leerling alleen door hem de eindresultaten te laten proeven: "Kijk, dit is de soep, maak hem precies zo." Dat noemen we 'Next-Token Alignment'. Het probleem? De leerling ziet de soep wel, maar hij begrijpt niet waarom de kok bepaalde ingrediënten koos of hoe hij de pan moest bewegen. Hierdoor maakt hij bij de volgende gerecht vaak fouten, omdat hij de 'flow' van het koken niet snapt.

Dit onderzoek introduceert Align-TI, een nieuwe manier van lesgeven die veel dieper gaat. In plaats van alleen naar het eindresultaat te kijken, kijkt Align-TI naar de interacties (de bewegingen en keuzes) van de meesterkok.

Dit doen ze met twee slimme technieken:

1. De "Focus-Spotlight" (IVA)

Stel je voor dat de meesterkok een foto van een drukke markt bekijkt en de vraag krijgt: "Waar is de rode appel?" Een gewone leerling zou naar de hele markt staren en overal tegelijk proberen te kijken, wat heel vermoeiend en inefficiënt is.

De IVA-techniek werkt als een spotlight. De meesterkok laat de leerling niet naar de hele markt kijken, maar wijst precies aan: "Kijk alleen naar dit kleine rode stipje daar in de hoek." De leerling leert dus om zijn beperkte aandacht precies op de juiste, belangrijke details te richten, in plaats van te verdwalen in de ruis van de achtergrond.

2. Het "Dansritme" (TPA)

Koken is een ritme: je snijdt de ui, dan gooi je hem in de pan, dan roer je. Als de leerling alleen de soep proeft, mist hij het ritme.

De TPA-techniek leert de leerling de "dans" van de meesterkok. Het kijkt niet alleen naar het volgende ingrediënt, maar naar de overgang tussen alle stappen. Het is alsof de meesterkok de leerling leert: "Als je eerst dit doet, is de kans groot dat je daarna dit wilt doen." Hierdoor leert de leerling de logica van het proces begrijpen. Als hij een klein foutje maakt, weet hij door dit ritme nog steeds hoe hij weer op de juiste weg moet komen, in plaats van dat de hele maaltijd mislukt (wat we 'exposure bias' noemen).

Het resultaat?

De onderzoekers hebben laten zien dat deze "slimme leerling" (het kleine model) verbazingwekkend goed wordt. Zelfs een heel klein model van de Align-TI-familie presteert beter dan een veel groter, zwaarder model dat op de oude manier is getraind.

Kortom: In plaats van de leerling alleen het menu te laten zien, laten we hem nu meekijken met de focus van de meester en het ritme van de keuken. Zo krijg je een kleine assistent die razendsnel is, weinig ruimte inneemt, maar wel de wijsheid van een grootmeester in zijn zak heeft!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →