ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models
ZOMP ist eine abfrageeffiziente, rein vorwärtsgerichtete Methode, die tiefe Prompts in den Vision- und Textzweigen eingefrorener CLIP-Modelle mittels simultaner Störung mit stochastischer Approximation optimiert und dabei bestehende Zero-Order-Ansätze über mehrere Benchmarks hinweg übertrifft, indem sie kreuzmodale Low-Rank-Reparametrisierung, Gradienten-Korrektur-Momentum und einen dynamischen Rank-Zeitplan nutzt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie hätten einen superintelligenten Roboter, der das gesamte Internet gelesen und gelernt hat, sowohl Bilder als auch Wörter zu verstehen. Er ist wie ein genialer Bibliothekar, der Ihnen sofort sagen kann, worum es in einem Foto geht, indem er es nur ansieht, oder eine Szene mit perfekten Sätzen beschreibt. Dieser Roboter wird ein Vision-Language-Modell genannt und ist unglaublich leistungsstark. Aber hier ist der Haken: Normalerweise müssen Sie dem Roboter, um ihm einen neuen Trick beizubringen – wie etwa das Erkennen einer bestimmten Art seltener Blumen oder eines seltsamen medizinischen Scans – erlauben, sein eigenes Gehirn „neu zu verdrahten“. Dieser Prozess ist schwerfällig, wie der Versuch, eine riesige Bibliothek umzustrukturieren, während sie noch für die Öffentlichkeit geöffnet ist, und er erfordert viel Rechenleistung und Speicherplatz.
Manchmal können Sie das jedoch nicht tun. Vielleicht lebt der Roboter auf einem winzigen, batteriebetriebenen Gerät in Ihrer Tasche, oder es ist ein Geheimdienst, mit dem Sie nur über ein Chat-Fenster kommunizieren können, das Ihnen nicht erlaubt, zu sehen, wie er denkt. In diesen Fällen können Sie das Gehirn des Roboters nicht neu verdrahten; Sie können ihm nur neue Anweisungen zuflüstern. Dies wird „Prompt Tuning“ genannt. Anstatt das Gehirn des Roboters zu verändern, geben Sie ihm eine spezielle Menge an Hinweisen oder „Prompts“, die ihm helfen, ein neues Rätsel zu lösen. Das Problem ist, dass das Finden der perfekten Hinweise normalerweise viel Ausprobieren erfordert, und wenn Sie nicht die inneren Gedanken des Roboters (Gradienten) sehen können, ist es, als würde man versuchen, eine Nadel im Heuhaufen zu finden, während man die Augen verbunden hat. Sie müssten vielleicht tausende Versuche unternehmen, um es richtig zu machen, was für das echte Leben zu langsam und zu teuer ist.
Hier kommt eine neue Methode namens ZOMP ins Spiel. Stellen Sie sich ZOMP als einen klugen Detektiv vor, der das „blind gefühlte Nadel-Problem“ löst, indem er die Art und Weise ändert, wie er sucht. Anstatt zu versuchen, jedes einzelne Detail des Hinweises auf einmal zu erraten, nutzt ZOMP eine intelligente Strategie, um zuerst die wichtigsten Teile zu erraten und dann langsam den Rest auszufüllen.
So funktioniert es, unter Verwendung einiger lustiger Metaphern:
Der „Gemeinsame Bauplan“-Trick
Normalerweise, wenn Sie versuchen, dem Roboter neue Dinge beizubringen, müssen Sie separate Hinweise für seine „Augen“ (Vision) und seine „Stimme“ (Text) schreiben. Wenn Sie versuchen, gleichzeitig tiefe, komplexe Hinweise für beide zu schreiben, wird die Anzahl der Möglichkeiten so riesig, dass die blind gefühlte Suche sich verirrt. ZOMP ändert das Spiel, indem es sagt: „Lasst uns einen gemeinsamen Bauplan verwenden.“ Stellen Sie sich vor, dass die Hinweise für die Augen und die Stimme beide aus demselben kleinen Satz von Lego-Steinen gebaut werden. Sie müssen nur herausfinden, wie man diese wenigen Steine anordnet, und sie bauen automatisch die richtigen Hinweise für die Augen und die Stimme zur gleichen Zeit. Dies hält den Suchraum klein und handhabbar, obwohl die Hinweise tief und komplex sind.
Die „Budget-indexierte“ Erweiterung
Selbst mit dem gemeinsamen Bauplan ist der Versuch, alle Steine auf einmal anzuordnen, immer noch zu schwierig, wenn man die Augen verbunden hat. ZOMP verwendet ein „Budget“-System. Stellen Sie sich vor, Sie haben eine begrenzte Anzahl an Versuchen (Queries), um den besten Hinweis zu finden. ZOMP beginnt damit, sich nur erlauben zu dürfen, mit dem allerersten, wichtigsten Stein zu spielen. Es findet die richtige Richtung für dieses eine Stück. Sobald es sicher ist, auf dem richtigen Weg zu sein, „entsperrt“ es den nächsten Stein, dann den nächsten, und erweitert die Suche langsam nur dann, wenn es eine zuverlässige Richtung hat. Es ist wie das Erlernen des Autofahrens: Man beginnt auf einem leeren Parkplatz (einem winzigen Suchraum), wird sich sicher fühlen und bewegt sich dann langsam auf die Nebenstraßen der Nachbarschaft und schließlich auf die Autobahn zu. Man versucht nicht, am ersten Tag bereits auf der Autobahn zu fahren.
Das „Momentum“-Gedächtnis
Da die Suche blind gefühlt ist, sind die Hinweise, die sie erhält, oft verrauscht und wackelig, wie der Versuch, auf einem Boot in unruhiger See zu gehen. ZOMB fügt ein „Momentum“-Gedächtnis hinzu. Denken Sie an dies als einen Surfer, der nicht einfach auf jede einzelne Welle reagiert, sondern sich an die allgemeine Richtung erinnert, in die der Ozean drückt. Selbst wenn eine Welle ihn zur Seite stößt, bewegt er sich weiter in die richtige Richtung, weil er sich erinnert, wohin er unterwegs war. Dies hilft dem Roboter, das Rauschen zu ignorieren und am Pfad festzuhalten, der tatsächlich funktioniert.
Die Ergebnisse
Die Forscher testeten diese Methode bei 13 verschiedenen Herausforderungen, von der Identifizierung von Blumen bis hin zum Erkennen von Fahrzeugen in Satellitenbildern. Sie gaben ZOMP und anderen Methoden exakt die gleiche Anzahl an Versuchen (5.000 Queries). Die Ergebnisse zeigten, dass ZOMP konsistent bessere Hinweise fand als die anderen Methoden. Es wurde nicht nur etwas besser; es war oft signifikant genauer, insbesondere bei schwierigen Aufgaben, bei denen der Roboter normalerweise Schwierigkeiten hat.
Was wirklich cool ist: ZOMP wurde nicht nur bei der spezifischen Aufgabe, für die es trainiert wurde, besser. Es wurde auch besser darin, mit neuen, seltsamen Situationen umzugehen (wie etwa dem Erkennen einer Skizze eines Objekts anstelle eines Fotos). Dies deutet darauf darauf hin, dass ZOMP durch das sorgfältige und effiziente Suchen einen klügeren Weg gelernt hat, das bestehende Wissen des Roboters zu nutzen, anstatt nur die Trainingsbeispiele auswendig zu lernen.
Kurz gesagt: ZOMP beweist, dass man das Gehirn des Roboters nicht neu verdrahten muss, um ihn intelligenter zu machen. Indem man einen gemeinsamen Bauplan verwendet, die Suche langsam erweitert und ein beständiges Gedächtnis für die Richtung behält, kann man einem leistungsstarken KI-Modell neue Tricks beibringen, selbst wenn man ihm nur zuflüstern kann und nur eine begrenzte Anzahl an Versuchen hat. Es ist eine praktische, effiziente Art, das Beste aus diesen riesigen Modellen herauszuholen, ohne einen Supercomputer in der Tasche zu benötigen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.