← Neueste Arbeiten
🤖 machine learning

Clustering and Token Denoising for Faster and More Robust VLMs

Das Papier stellt ClustRS vor, einen trainingsfreien Algorithmus, der aufmerksamkeitsgewichtiertes Clustering mit Residual-Shrinkage-Denoising kombiniert, was die Anzahl der visuellen Token um bis zu 97 % signifikant reduziert und gleichzeitig die Robustheit gegenüber Bildrauschen erhöht sowie die Leistung bei VLM-Benchmarks wie ScienceQA-IMG und MM-VET beibehält oder verbessert.

Ursprüngliche Autoren: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

Veröffentlicht 2026-08-21
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Computer vor, der ein Foto sehen und dann Fragen dazu beantworten, eine Szene beschreiben oder ein Rätsel lösen kann, das auf dem basiert, was er sieht. Dies ist das Versprechen moderner visuell-linguistischer Modelle, einer Art von künstlicher Intelligenz, die die Fähigkeit zum Verständnis von Bildern mit der Fähigkeit zur Generierung menschenähnlicher Texte kombiniert. Damit diese Systeme funktionieren, müssen sie ein Bild zuerst in eine lange Liste digitaler Bausteine übersetzen, die sogenannten Token, welche das Gehirn des Computers dann verarbeitet, um eine Antwort zu formulieren. Je detaillierter das Bild ist, desto länger wird diese Liste. Während dies eine große Genauigkeit ermöglicht, schafft es einen massiven Engpass: Das Verarbeiten von hunderten dieser Token erfordert enorme Rechenleistung, was es schwierig macht, diese intelligenten Systeme auf kleineren Geräten wie Smartphones oder Drohnen laufen zu lassen. Forscher suchen schon lange nach Wegen, diese Liste zu kürzen, indem sie die unnötigen Teile entfernen und gleichzeitig die wichtigen behalten, aber bestehende Methoden haben oft Schwierigkeiten, wenn die Bilder unvollkommen oder verrauscht sind – so wie es bei den meisten realen Fotos tatsächlich der Fall ist.

Ein Team von Forschern hat eine neue, leichtgewichtige Methode entwickelt, um dieses Problem zu lösen, ohne die komplexen KI-Modelle von Grund auf neu trainieren zu müssen. Ihr Ansatz, den sie ClustRS nennen, fungt wie ein hocheffizienter Editor für die Liste der Bild-Token. Anstatt einfach nur die offensichtlichsten Teile eines Bildes auszuwählen oder zu versuchen, eine große Vielfalt an Teilen beizubehalten, gruppiert ihr System zunächst ähnliche Informationsteile zusammen. Es wählt dann nur einen Repräsentanten aus jeder Gruppe aus und stellt so sicher, dass die endgültige Liste die verschiedenen Ideen im Bild abdeckt, ohne sich selbst zu wiederholen. Entscheidend ist, dass dieser Gruppierungsprozess darauf ausgelegt ist, das visuelle „Rauschen“ oder die Störungen zu ignorieren, die reale Fotos oft plagen, wie etwa Körnigkeit oder Unschärfe, um zu verhindern, dass das System durch korrupte Daten in die Irre geführt wird.

Nachdem die besten Repräsentanten ausgewählt wurden, wendet die Methode einen zweiten, verfeinernden Schritt an. Sie nimmt die gewählten Token und glättet das Rauschen innerhalb dieser Token sanft, indem sie die durchschnittlichen Merkmale ihrer Gruppe nutzt, um etwaige Fehler zu korrigieren. Dieser Prozess erfolgt vollständig automatisch und erfordert kein zusätzliches Training, was bedeutet, dass er sofort auf bestehende Modelle angewendet werden kann. Die Forscher testeten diese Technik an Standard-Benchmarks, die messen, wie gut diese Modelle über Bilder urteilen können, einschließlich Aufgaben, die das Beschreiben komplexer Szenen oder das Beantworten wissenschaftlicher Fragen erfordern. Sie fanden heraus, dass ihre Methode bisherige Techniken deutlich übertraf, insbesondere wenn die Bilder stark durch Rauschen verzerrt waren oder wenn die Anzahl der erlaubten Token drastisch reduziert wurde. In den extremsten Tests, bei denen das System gezwungen war, mit nur sechzehn Token statt der üblichen Hunderte zu arbeiten, behielt ihre Methode eine hohe Genauigkeit bei, während andere versagten, was bewies, dass eine intelligentere Art der Auswahl und Reinigung von Informationen wertvoller ist als einfach nur mehr Daten zu haben.

Der Erfolg dieses Ansatzes unterstreicht einen Wandel in der Art und Weise, wie wir effiziente künstliche Intelligenz bauen könnten. Anstatt zu versuchen, die Modelle größer oder komplexer zu machen, um schwierige Bedingungen zu bewältigen, zeigten die Forscher, dass ein einfacher, zweistufiger Prozess aus Gruppierung und Reinigung bestehende Systeme viel robuster machen kann. Ihre Ergebnisse legen nahe, dass für diese Modelle, um in der realen Welt – in der Bilder selten perfekt und die Rechenleistung oft begrenzt ist – wirklich nützlich zu sein, der Fokus auf der Qualität und Widerstandsfähigkeit der verarbeiteten Informationen liegen sollte und nicht nur auf deren Quantität. Indem sie demonstrierten, dass diese Verbesserungen ohne die hohen Kosten eines erneuten Trainings erreicht werden können, öffnet die Arbeit die Tür für den Einsatz leistungsstarker visueller Intelligenz auf einer viel breiteren Palette von Alltagsgeräten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →