← Neueste Arbeiten
🤖 machine learning

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge ist ein hardwarebewusstes Framework für die neuronale Architektursuche, das Infinite-Head Attention und ein Multi-Backend-Kostenmodell nutzt, um automatisch optimierte Sprachmodelle mit weniger als einer Milliarde Parametern zu generieren, die auf spezifische Randgerätebeschränkungen zugeschnitten sind, und damit im Vergleich zu bestehenden Baselines signifikante Verbesserungen bei der Energieeffizienz, der Latenz und der Modellgenauigkeit erzielt.

Ursprüngliche Autoren: Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, das perfekte, winzige Roboter-Gehirn zu bauen, das auf einem Smartphone oder einer Smartwatch laufen kann. Sie wollen, dass es intelligent genug ist, um Sprache zu verstehen, aber klein genug, um in Ihre Tasche zu passen, ohne den Akku zu entleeren oder das Telefon heiß zu machen.

Das Problem ist, dass die Standard„Baupläne" für diese Gehirne (sogenannte Transformer) für massive Supercomputer entwickelt wurden. Wenn Sie versuchen, sie für Edge-Geräte zu verkleinern, geraten sie oft in Staus, laufen aus dem Speicher oder verbrauchen zu viel Energie.

LLMForge ist ein neues Werkzeug, das von Forschern entwickelt wurde, um dieses Problem zu lösen. Stellen Sie es sich als einen superintelligenten, hardwarebewussten Architekten vor, der das Gehirn nicht nur verkleinert, sondern den Bauplan vollständig neu gestaltet, basierend auf dem spezifischen „Gelände" des Geräts, auf dem es leben wird.

So funktioniert LLMForge, aufgeteilt in drei einfache Teile:

1. Die Infinite-Head-Attention (IHA): Die Regeln brechen

Traditionelle Roboter-Gehirne haben ein starres Regelbuch. Wenn Sie die Anzahl der „Denkköpfe" (Prozessoren, die verschiedene Teile eines Satzes betrachten) erhöhen wollen, sind Sie gezwungen, jeden Kopf kleiner zu machen. Es ist wie eine Pizza: Wenn Sie sie in mehr Scheiben schneiden, wird jede Scheibe kleiner. Dies begrenzt, wie intelligent das Gehirn sein kann.

Die Innovation von LLMForge: Es wirft das starre Regelbuch weg. Mit Infinite-Head-Attention kann der Architekt die Anzahl der Scheiben, die Größe der Scheiben und die Art der Beläge unabhängig für jede einzelne Schicht des Gehirns ändern.

  • Die Analogie: Stellen Sie sich ein Bauunternehmen vor, das normalerweise Räume in identischen Größen bauen muss. LLMForge gibt ihnen ein magisches Werkzeug, das es ihnen erlaubt, einen winzigen Schrank neben einen riesigen Ballsaal zu bauen, dann ein mittelgroßes Büro, alles innerhalb desselben Grundrisses. Dies erweitert die Anzahl möglicher Baupläne um das 400-fache und ermöglicht es ihnen, eine Form zu finden, die perfekt in die Einschränkungen eines bestimmten Geräts passt.

2. Forge-Former: Die Kristallkugel

Das Bauen und Testen eines neuen Gehirnbauplans von Grund auf ist teuer und langsam. Es ist wie das Backen eines Kuchens, nur um zu sehen, ob das Rezept funktioniert, und ihn dann wegzuwerfen. Wenn Sie Tausende von Rezepten testen müssen, wären Sie pleite.

Die Lösung von LLMForge: Sie haben eine Kristallkugel namens Forge-Former gebaut.

  • Wie es funktioniert: Anstatt jeden einzelnen Kuchen zu backen, betrachtet die Kristallkugel das Rezept (den Bauplan) und sagt genau vorher, wie gut der Kuchen schmecken wird (wie intelligent das Modell sein wird) und wie viel Energie es verbrauchen wird.
  • Das Ergebnis: Diese Kristallkugel ist viel genauer als frühere „Ratgeber"-Werkzeuge. Sie ermöglicht es dem System, Tausende von Designs in der Zeit zu testen, die früher zum Testen nur weniger reichte, und spart enorme Mengen an Zeit und Energie.

3. Forge-DSE: Der Multi-Tool-Navigator

Verschiedene Geräte haben verschiedene Probleme. Eine High-End-Grafikkarte (GPU) könnte durch die Geschwindigkeit, mit der sie Daten bewegen kann, begrenzt sein, während ein winziger Chip in einer Smartwatch durch die Wärmemenge begrenzt sein könnte, die er verkraften kann. Ein Design, das für das eine perfekt ist, kann für das andere schrecklich sein.

Der Ansatz von LLMForge: Die Forge-DSE-Engine fungiert wie ein Navigator mit einem Multi-Tool.

  • Sie sucht nicht nur nach dem „intelligentesten" Modell. Sie sucht nach dem besten Kompromiss (eine „Pareto-Front") zwischen Intelligenz, Geschwindigkeit und Energieeffizienz.
  • Sie testet die Designs gegen vier verschiedene Hardware-Typen (wie eine Hochgeschwindigkeits-GPU, einen spezialisierten Chip und einen ringförmigen Chip).
  • Das Ergebnis: Das System erkennt, dass „eine Größe für alle nicht passt". Es produziert verschiedene, einzigartige Baupläne für jedes Gerät.
    • Für ein geschwindigkeitsorientiertes Gerät baut es ein Gehirn, das breit und flach ist.
    • Für ein energieorientiertes Gerät baut es ein Gehirn, das tief und schmal ist.

Die Ergebnisse: Realwelt-Erfolge

Die Forscher testeten dieses System an zwei Modellgrößen (etwa 100 Millionen und 300 Millionen Parameter) und verglichen sie mit bestehenden populären Modellen wie SmolLM2 und Qwen.

  • Das „Genauigkeits"-Modell: Einer ihrer neuen Designs war intelligenter (niedrigere Fehlerrate) als die Konkurrenz, obwohl es weniger Parameter hatte (es war kleiner).
  • Das „Energie"-Modell: Ein anderes Design verbraucht 40 % weniger Energie pro generiertem Wort im Vergleich zu den Standardmodellen.
  • Das „Geschwindigkeits"-Modell: Ein drittes Design war 43 % schneller beim Starten der Rede (Time-to-First-Token) und beim Abschließen von Sätzen.

Zusammenfassung

LLMForge ist ein System, das aufhört, einen „Einheits"-Gehirn-Bauplan auf jedes Gerät zu zwingen. Stattdessen verwendet es eine flexible Designsprache, eine schnelle Vorhersage-Kristallkugel und einen intelligenten Navigator, um ein maßgeschneidertes Gehirn für jede spezifische Hardware zu entwickeln. Das Ergebnis ist eine kleinere, schnellere und energieeffizientere KI, die tatsächlich in Ihre Tasche passt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →