← Neueste Arbeiten
🤖 AI

Accelerating Vision Transformers on Brain Processing Unit

Dieses Paper schlägt eine neuartige Methode vor, um Vision Transformer auf CNN-optimierten Brain Processing Units (BPUs) zu beschleunigen, indem das Modell so umstrukturiert wird, dass lineare Schichten durch Faltungsoperatoren ersetzt werden, was eine Gewichtvererbung ohne erneutes Training ermöglicht und gleichzeitig signifikante Beschleunigungen bei der Inferenz mit minimalem Genauigkeitsverlust erzielt.

Ursprüngliche Autoren: Jinchi Tang, Yan Guo

Veröffentlicht 2026-02-09
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jinchi Tang, Yan Guo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen super-effizienten, spezialisierten Fabrikarbeiter namens BPU (Brain Processing Unit). Dieser Arbeiter ist ein Meister darin, 4D-Lego-Steine zu montieren (die Bilddaten wie Höhe, Breite, Farbkanäle und Batches repräsentieren). In der Welt der künstlichen Intelligenz ist dieser Arbeiter der Experten-Maurer für den Bau von CNNs (Convolutional Neural Networks), welche die traditionellen „Steinsetzer“ der Computer Vision sind.

Doch ein neuer, revolutionärer Architekt namens Vision Transformer (ViT) ist angekommen. Anstatt mit 4D-Lego-Steinen zu bauen, arbeitet der ViT mit 3D-Papierstapeln (Sequenzen von Daten). Er ist unglaublich intelligent und liefert oft bessere Ergebnisse, aber er spricht eine andere Sprache. Wenn Sie versuchen, den BPU-Fabrikarbeiter einzustellen, um einen ViT zu bauen, wird er verwirrt. Er ist darauf ausgelegt, Steine zu stapeln, nicht Papierstapel zu sortieren. Infolgedessen muss der ViT von einem viel langsameren, universellen Arbeiter (der CPU) gebaut werden, während der super-schnelle BPU untätig herumsteht.

Die Lösung aus Papier: Der „Formwandler“-Trick

Die Autoren dieser Arbeit, Jinchi Tang und Yan Guo, kamen auf eine clevere Umgehungslösung. Sie haben nicht versucht, dem BPU beizubringen, Papierstapel zu lesen (was schwierig wäre und ein erneutes Training des gesamten Systems erfordern würde). Stattdessen haben sie die Papierstapel so umgestaltet, dass sie wie Lego-Steine aussehen.

So haben sie es gemacht, unter Verwendung einfacher Analogien:

  1. Das Problem der Linearen Schicht (Linear Layer): In einem Standard-ViT nutzt das Gehirn „Lineare Schichten“, um Informationen zu verarbeiten. Stellen Sie sich diese als einen Übersetzer vor, der eine Liste von Wörtern liest und eine neue Liste ausgibt. Der BPU kann keine Listen lesen; er versteht nur 4D-Gitter.

    • Die Lösung: Die Autoren haben den „Übersetzer“ genommen und seine Anweisungen so umgestaltet, dass sie wie ein 1x1 Lego-Stein aussieht. Mathematisch gesehen erledigt er exakt dieselbe Aufgabe, aber jetzt passt er perfekt in die BPU-Fabrik. Es ist, als würde man eine flache Karte zu einem Zylinder rollen, nur damit sie in ein bestimmtes Rohr passt, ohne den Inhalt der Karte zu verändern.
  2. Das Problem der Schichtnormalisierung (Layer Normalization): Der ViT verwendet auch einen Schritt namens „Layer Normalization“, um seine Daten im Gleichgewicht zu halten (wie ein Thermostat, der die Temperatur in einem Raum konstant hält). Der BPU hat keinen eingebauten Thermostat.

    • Die Lösung: Die Autoren haben einen „Thermostaten“ aus den vorhandenen Lego-Steinen des BPU gebaut. Sie erschufen eine spezielle Kette aus winzigen Steinen (1x1 Konvolutionen), die den Durchschnitt und die Varianz berechnet und so den Thermostaten mithilfe der Werkzeuge nachahmt, die der BPU bereits besitzt.

Die Magie von „Kein Nachtraining“ (No Retraining)

Normalerweise, wenn man den Bauplan eines Gebäudes ändert, muss man es abreißen und von Grund auf neu aufbauen. Aber weil die Autoren bei ihrem „Formwandler-Trick“ so sorgfältig waren, dass ihre „Lego-Steine“ mathematisch identisch mit den ursprünglichen „Papierstapeln“ sind, funktionieren die ursprünglichen Baupläne (Gewichte) weiterhin perfekt.

Sie mussten das Modell nicht neu trainieren oder ihm neue Dinge beibringen. Sie haben einfach ihr vortrainiertes „DeiT“-Modell (eine populäre, effiziente Version des ViT) genommen, ihren Formwandler-Trick angewendet und es dem BPU übergeben. Der BPU erkannte das neue Format sofort und arbeitete mit voller Geschwindigkeit.

Die Ergebnisse: Geschwindigkeit vs. Genauigkeit

Das Team testete dies bei zwei verschiedenen Aufgaben: der Erkennung von tausenden Objekten (ImageNet) und dem Sortieren von Blumen.

  • Der Kompromiss: Wenn man ein Modell konvertiert, um auf dieser spezialisierten Hardware zu laufen, verliert man normalerweise ein kleines bisschen an Präzision (wie beim Wechsel von einem hochauflösenden Foto zu einem leicht komprimierten JPEG).
    • Beim großen ImageNet-Test sank die Genauigkeit des DeiT-Base Modells nur um 1,4 % (von 81,8 % auf 80,4 %).
    • Beim Blumen-Test war der Abfall sogar noch geringer, nämlich nur 0,5 %.
  • Die Belohnung: Im Austausch für diesen minimalen Genauigkeitsverlust wurde das Modell viel schneller.
    • Das größte Modell (DeiT-Base) lief auf dem BPU 3,8-mal schneller als auf der Standard-CPU.
    • Die kleineren Modelle zeigten ebenfalls Geschwindigkeitssteigerungen, die zwischen 1,3x und 2,1x lagen.

Eine amüsante Entdeckung

Während ihrer Tests bemerkten die Autoren etwas Interessantes. Manchmal waren die offiziellen Etiketten auf den Testbildern falsch (z. B. war ein Bild eines „Löwen“ als „Affe“ beschriftet). Das ursprüngliche DeiT-Modell identifizierte den Löwen korrekt, aber das System markierte dies als Fehler, weil das Label fehlerhaft war. Das neue, schnelle Modell der Autoren identifizierte den Löwen ebenfalls korrekt. Dies deutet darauf darauf hin, dass das Modell eigentlich noch intelligenter ist, als die offiziellen Werte vermuten lassen, da es die „Tippfehler“ in den Testdaten durchschauen kann.

Zusammenfassend

Diese Arbeit ist das erste Mal, dass es jemandem gelungen ist, einen Vision Transformer (den „Papierstapel“-Architekten) erfolgreich auf einem spezialisierten Brain Processing Unit (der „Lego“-Fabrik) zum Laufen zu bringen, ohne den Architekten von Grund auf neu entwerfen zu müssen. Durch die geschickte Umgestaltung der Mathematik, um sie an die Hardware anzupassen, erreichten sie einen 3,8-fachen Geschwindigkeitsvorteil bei fast keinem Verlust an Intelligenz. Dies beweist, dass diese fortschrittlichen KI-Modelle endlich effizient auf spezialisierten, eingebetteten Chips laufen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →