← Neueste Arbeiten
🤖 machine learning

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

Dieses Paper schlägt DualSpeed vor, ein Fast-Slow-Trainingsframework, das visuelles Token-Pruning für Effizienz mit einem Full-Sequence-Hilfsmodus und Selbstdistillation kombiniert, um Trainings-Inferenz-Diskrepanzen zu lösen, wodurch das Training von MLLMs um bis zu 4,0× beschleunigt wird, ohne die Leistung zu beeinträchtigen.

Ursprüngliche Autoren: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Veröffentlicht 2026-02-04
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem sehr klugen Schüler (einem Multimodalen Large Language Model) die Welt beizubringen, indem Sie ihm tausende Bilder zeigen.

Das Problem: Der „Zu viele Informationen“-Engpass
Momentan sind diese Modelle wie Schüler, die überfordert sind. Wenn man ihnen ein Bild zeigt, zerlegt der Computer es in hunderte oder sogar tausende winzige Teile, sogenannte „visuelle Token“. Es ist, als würde man dem Schüler für jedes einzelne Bild ein 1.000-seitiges Buch überreichen, obwohl die meisten Seiten nur aus leerem weißem Raum oder repetitiven Mustern bestehen.

Der Versuch, all diese Seiten zu lesen, dauert ewig. Das macht das Training dieser Modelle unglaublich langsam, teuer und energiehungrig.

Die alte Idee: Der „Ausschneiden-und-Einfügen“-Fehler
Forscher erkannten, dass viele dieser Seiten nutzlos und redundant sind. Sie versuchten eine Technik namens Visual Token Pruning, was so ähnlich ist, als würde man einen Textmarker benutzen, um die langweiligen, redundanten Seiten durchzustreichen, bevor man dem Schüler das Buch zeigt. Das funktioniert bei der späteren Anwendung (Inference) hervorragend, um die Modelle schneller zu machen.

Aber als sie diese Methode während des Trainings anwendeten, schlug es fehl und erzeugte einen „Mismatch“ (eine Diskrepanz).

  • Die Analogie: Stellen Sie sich vor, Sie hätten den Schüler immer nur mit einer 10-seitigen Zusammenfassung eines Buches trainiert. Dann überreichen Sie ihm bei der Abschlussprüfung das vollständige 1.000-seitige Buch. Der Schüler würde Panik bekommen und durchfallen, weil er nie gelernt hat, mit der Vollversion umzugehen. Er hat sich zu sehr an die Kurzfassung gewöhnt.

Die Lösung: DualSpeed (Das „Schnell-Langsam“-Trainingslager)
Die Autoren dieser Arbeit, Dingkun Zhang und sein Team, entwickelten ein neues Trainings-Framework namens DualSpeed. Betrachten Sie es als ein Zwei-Spur-Trainingslager, das zwischen zwei Modi hin und her wechselt, um das Mismatch-Problem zu lösen.

  1. Die Schnelle Spur (Das schnelle Üben):

    • Die meiste Zeit (etwa 90 % der Sitzungen) trainiert das Modell im „Fast Mode“.
    • Hier nutzen sie die „Pruning“-Technik, um die nutzlosen visuellen Token herauszuschneiden. Das Modell lernt schnell aus den effizienten, gekürzten Zusammenfassungen.
    • Um dem Modell zu helfen, sich zu merken, welche Version es gerade vor sich hat, fügen sie am Anfang der Kurzfassung ein winziges, unsichtbares „Namensschild“ (einen sogenannten Mode Isolator) hinzu. Dies sagt dem Modell: „Hey, das ist die gekürzte Version; konzentriere dich auf die wesentlichen Details.“
  2. Die Langsame Spur (Die Voll-Buch-Rezension):

    • Gelegentlich (etwa 10 % der Zeit) wechselt das Modell in den „Slow Mode“.
    • Hier zeigen sie dem Modell das vollständige, ungekürzte Bild (alle 1.000 Seiten).
    • Um sicherzustellen, dass das Modell während dieser seltenen Sitzungen nicht nachlässig wird, verwenden sie einen Trick namens Self-Distillation. Der „Fast Mode“ (der bereits viel gelernt hat) fungt als Lehrer, der dem „Slow Mode“-Schüler die Antworten zuflüstert. Dies stellt sicher, dass der Schüler die Vollversion effektiv lernt, auch wenn er sie seltener sieht.

Das Ergebnis: Das Beste aus beiden Welten
Durch das Mischen dieser beiden Modi erhält das Modell die Geschwindigkeit der schnellen Spur, behält aber die Fähigkeit bei, die volle, komplexe Welt der langsamen Spur zu bewältigen.

  • Geschwindigkeit: Sie trainierten Modelle 2,1-mal bis 4,0-mal schneller als zuvor.
  • Leistung: Trotz der Geschwindigkeit wurden die Modelle nicht dümmer. Sie behielten über 99 % ihrer ursprünglichen Leistung bei.
  • Flexibilität: Das fertige Modell ist klug genug, um sowohl die kurzen Zusammenfassungen (wenn man später Geschwindigkeit möchte) als auch die vollständigen Bilder (wenn man maximale Genauigkeit möchte) zu verarbeiten.

Zusammenfassend
Die Arbeit behauptet, dass man durch ein „Schnell-Langsam“-Wechselsystem diese massiven KI-Modelle viel schneller trainieren kann, ohne dass sie verlernen, die vollständigen Bücher zu lesen. Sie fanden heraus, dass etwa 90 % der visuellen Token während des Trainings tatsächlich redundant sind, und dass man durch das kluge Wegschneiden dieser Token (während man gelegentlich mit der Vollversion übt) massiv Zeit und Geld sparen kann, ohne die Intelligenz zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →