← Neueste Arbeiten
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Das Paper stellt Eddy-VL 1.9B vor, ein komprimiertes multimodales Embedding-Modell, das für den Einsatz auf Edge-Geräten konzipiert wurde und durch probengesteuerte strukturelle Pruning-Verfahren und geschichtete Wissensdestillation 91,7 % der Leistung seines 2,13B-Lehrermodells erreicht, während es die Parameteranzahl um 9,5 % und die Latenz um 10 % reduziert.

Ursprüngliche Autoren: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Veröffentlicht 2026-07-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Computer gleichzeitig „sehen“ und „lesen“ können, also ein Bild einer Katze auf einer Matte genauso gut verstehen wie die Worte „Katze auf Matte“. Dies ist das Reich der multimodalen KI, eines Zweigs der Wissenschaft, in dem Maschinen lernen, Bilder, Text und Video in eine einzige, gemeinsame Sprache zu verbinden. Um dies zu erreichen, fungieren diese KI-Modelle wie riesige Übersetzer, die alles, was sie sehen, in eine lange Liste von Zahlen verwandlichen, die man Embedding nennt. Betrachten Sie ein Embedding als einen einzigartigen Fingerabdruck für ein Stück Inhalt; wenn zwei Fingerabdrücke sehr ähnlich sind, weiß der Computer, dass der Inhalt miteinander verwandt ist.

Es gibt jedoch einen Haken. Die klügsten Übersetzer sind meistens auch die schwerfälligsten. Sie sind wie massive Supercomputer in der Cloud, die eine konstante, Hochgeschwindigkeits-Internetverbindung benötigen, um zu funktionieren. Aber was, wenn Sie sich in einem geheimen Keller, einem Polizeibeweismittelraum oder einer abgelegenen Forschungsstation befinden, in der das Internet abgeschaltet ist? Sie benötigen einen Übersetzer, der klug genug ist, komplexe Hinweise zu verstehen, aber klein genug, um auf einen lokalen Laptop oder ein Handheld-Gerät zu passen. Dies ist die Herausforderung des Edge-Deployments: leistungsstarke KI offline, schnell und ohne die Notwendigkeit einer Cloud-Verbindung zum Laufen zu bringen.

Hier kommt Eddy-VL 1.9B ins Spiel, ein neues Modell, das speziell für diese „Air-Gapped“-Situationen entwickelt wurde, in denen Privatsphäre und Geschwindigkeit alles sind. Die Forscher hinter diesem Projekt begannen mit einem sehr klugen, aber sehr schweren Lehrer-Modell namens Qwen3-VL-Embedding-2B. Dieser Lehrer ist wie ein brillanter Professor mit 28 Schichten tiefen Denkens, aber er ist zu sperrig, um ihn im Rucksack mitzunehmen. Das Team stellte eine einfache Frage: Können wir diesen Professor verkleinern, ohne dass er vergisst, wie man lehrt?

Sie haben nicht einfach wahllos Teile herausgeschnitten; sie verwendeten eine clevere Strategie namens strukturelles Pruning. Stellen Sie sich das Gehirn des Lehrers wie ein 28-stöckiges Gebäude vor. Die Forscher nutzten eine spezielle „Sonde“, um zu messen, wie stark jede Etage die Arbeit der Etagen direkt darüber und darunter wiederholte. Sie fanden heraus, dass vier spezifische Etagen viel redundante Arbeit leisteten – wie vier identische Fotokopierer in einer Reihe, wenn einer ausreichen würde. Sie entfernten diese vier Etagen und reduzierten das Gebäude so von 28 Stockwerken auf 24.

Aber hier liegt der knifflige Teil: Wenn man Etagen aus einem Gebäude entfernt, könnten die Menschen im obersten Stockwerk die Orientierung verlieren. Um dies zu beheben, nutzte das Team die Layered Distillation. Stellen Sie sich dies wie einen Meisterarchitekten (den ursprünglichen 28-stöckigen Lehrer) vor, der einen neuen, kleineren Architekten (den 24-stöckigen Schüler) anleitet. Der Lehrer sagt nicht nur „baue es“; er zeigt dem Schüler genau, wie er bei jedem Schritt denken muss. Sie verwendeten eine Technik namens CKA (die misst, wie ähnlich die Gedanken zweier Schichten sind), um sicherzustellen, dass die mittleren Schichten des Schülers genau so dachten wie die des Lehrers, und sie nutzten eine spezielle „Matryoshka“-Methode für die endgültige Antwort, um sicherzustellen, dass der Schüler Antworten unterschiedlicher Größe je nach Bedarf liefern konnte.

Das Ergebnis ist Eddy-VL 1.9B. Es ist ein Modell mit etwa 1,93 Milliarden Parametern, das 3,85 GB wiegt – klein genug, um auf vielen modernen Geräten Platz zu finden. In Tests bewältigte dieses „geschrumpfte“ Modell etwa 91,7 % der Intelligenz des ursprünglichen Lehrers. Während der ursprüngliche Lehrer 68,9 bei einem massiven Test mit 78 verschiedenen Aufgaben (genannt MMEB-V2) erreichte, erzielte Eddy-VL 63,2. Das mag nach einem Abfall klingen, aber denken Sie daran, dass das Modell vier ganze Schichten des Denkens verloren hat! Ohne die speziellen Lehrmethoden wäre die Punktzahl auf 56,8 abgestürzt. Der Destillationsprozess konnte erfolgreich 6,4 Punkte dieses verlorenen Bodens zurückgewinnen.

Das Modell erhielt auch einen Geschwindigkeitsschub. Da es weniger Schichten zu verarbeiten hat, läuft es etwa 10 % schneller als das Original und benötigt 136,4 Millisekunden pro Bild statt 150,0 Millisekunden. Das mag nicht nach einem riesigen Unterschied klingen, aber in einer realen Untersuchung, bei der Sie tausende beschlagnahmte Fotos offline scannen, summieren sich diese zusätzlichen Sekunden zu gesparten Stunden.

Die Forscher waren sorgfältig darauf bedacht, anzugeben, wo das Modell noch an seine Grenzen stößt. Während es fast so gut wie der Lehrer darin wurde, komplexe Beziehungen zwischen Wörtern und Bildern zu verstehen (es erreichte 86,1 % in einem Test gegenüber 86,4 % beim Lehrer), hatte es noch etwas Schwierigkeiten mit einer speziellen Art von Rätsel namens Winoground, bei dem es 6,8 gegenüber 8,5 beim Lehrer erreichte. Dies deutet darauf hin, dass das Modell zwar exzellent für die allgemeine Informationsbeschaffung ist, aber einige sehr knifflige logische Rätsel immer noch das volle, unbeschnittene Gehirn erfordern.

Letztendlich ist Eddy-VL 1.9B kein Allheilmittel, das jedes Problem löst, aber es ist ein leistungsstarkes Werkzeug für eine ganz bestimmte Aufgabe. Es beweist, dass man eine massive, Cloud-lastige KI in ein leichtgewichtiges, offline-fähiges Paket komprimieren kann, ohne zu viel von ihrer Seele zu verlieren. Für Ermittler, Forensiker und alle, die an Orten arbeiten, an denen das Internet ein Luxus ist, den sie sich nicht leisten können, bietet dieses Modell eine Möglichkeit, das Licht an der Kippschalter zu lassen und die Intelligenz hoch zu halten, direkt an der Grenze des Netzwerks.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →