Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels
Kernel Forge ist ein quelloffenes, End-to-End-agentisches Harness, das Large Language Models und Monte Carlo Tree Search nutzt, um CUDA-Kernel für diverse PyTorch-Workloads automatisch zu generieren und zu optimieren, wobei es signifikante Beschleunigungen gegenüber dem PyTorch Eager Mode erzielt und gleichzeitig eine grafische Benutzeroberfläche zur Inspektion und zum Debugging bereitstellt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, ein Videospiel auf Ihrem Computer zu spielen. Manchmal läuft das Spiel flüssig, aber manchmal ruckelt oder laggt es. Das passiert, weil der Computer jede Sekunde Millionen von winzigen mathematischen Berechnungen durchführen muss, um die Bilder zu zeichnen und die Physik zu berechnen. In der Welt der Künstlichen Intelligenz (KI) sind diese Berechnungen sogar noch intensiver. Um eine KI „denken“ zu lassen, greift sie auf spezielle, Hochgeschwindigkeits-Anweisungen zurück, die Kernel genannt werden. Denken Sie an einen Kernel als ein spezifisches, super-effizientes Rezept, das ein Koch verwendet, um Gemüse zu schneiden. Wenn der Koch ein stumpfes Messer und eine langsame Methode verwendet, kommt das Abendessen zu spät. Wenn er ein scharfes, spezialisiertes Messer verwendet, ist das Essen sofort fertig.
Jahrelang war das Schreiben dieser „Rezepte“ für KI so, als würde man versuchen, einen Roman in einer Sprache zu schreiben, die man kaum spricht. Es erfordert hochqualifizierte Experten, um komplexe Anweisungen für Computerschips (GPUs) zu handcodieren, damit diese schneller laufen. Aber jetzt haben wir eine neue Art von Helfer: Large Language Models (LLMs). Sie kennen sie vielleicht als intelligente Chatbots, die Geschichten schreiben oder Matheaufgaben lösen können. Wissenschaftler bringen diesen Chatbots nun bei, die „Rezepte“ (Kernel) für KI zu schreiben, in der Hoffnung, dass sie dies schneller und besser als Menschen können. Es gibt jedoch einen Haken: Nur weil ein Chatbot ein Rezept schreibt, das auf dem Papier gut aussieht, bedeutet das nicht, dass er die Mahlzeit in einer echten Küche auch tatsächlich schneller zubereitet.
Hier kommt ein neues Projekt namens Kernel Forge ins Spiel. Forscher der University of Michigan haben ein intelligentes System entwickelt, das nicht einfach nur einen Chatbot bittet, Code zu schreiben; es agiert wie ein Vollzeit-Coach, ein Qualitätskontrolleur und ein Projektmanager in einem. Sie wollten sehen, ob KI tatsächlich die Aufgabe übernehmen kann, diese Rezepte für reale KI-Modelle zu optimieren, und nicht nur für künstliche, ausgedachte Testfälle.
Das Problem: Die „isolierte“ Falle
Stellen Sie sich vor, Sie trainieren einen Roboter zum Laufen. Wenn Sie ihn nur auf einer perfekt flachen, leeren Bahn testen, mag er wie ein Weltklasse-Sprinter aussehen. Aber sobald Sie ihn auf eine holprige, belebte Stadtstraße setzen, stolpert er vielleicht und fällt hin. Genau das passierte bei früheren Versuchen, KI zu nutzen, um GPU-Kernel zu schreiben. Die meisten Tools testeten die KI, indem sie ihr zufällige, künstliche Matheprobleme auf einer leeren Bahn gaben. Sie generierten ein Stück Code, testeten es isoliert und sagten: „Schau mal, wie schnell das ist!“
Aber in der realen Welt sind KI-Modelle wie belebte Städte. Die „Rezepte“ (Kernel) müssen mit spezifischen Datenformen funktionieren, mit spezifischen Mengen an Speicher arbeiten und sie müssen gut mit den anderen Rezepten direkt daneben harmonieren. Ein Rezept, das in einem zufälligen Test schnell ist, kann langsam sein oder sogar kaputtgehen, wenn es innerhalb eines echten KI-Modells verwendet wird, wie etwa jenen, die Bilder generieren oder mit Ihnen chatten. Frühere Tools überließen es oft menschlichen Entwicklern herauszufinden, wie sie diese neuen, von KI geschriebenen Rezepte wieder in die komplexe Maschine integrieren können, was mühsam und fehleranfällig war.
Die Lösung: Kernel Forge
Die Forscher entwickelten Kernel Forge, ein Open-Source-Tool, das als Brücke zwischen dem KI-Schreiber und der realen Welt fungiert. Anstatt die KI nur raten zu lassen, beobachtet Kernel Forge zuerst ein echtes KI-Modell (wie eines, das Gesichter erkennt oder Geschichten schreibt), während es auf einem Computer läuft. Es macht sich Notizen darüber, welche „Rezepte“ genau verwendet werden, wie groß die Daten sind und wie lange sie zur Ausführung benötigen.
Sobald es diese realen Daten hat, übergibt es den Auftrag an einen KI-Agenten (einen smarten Bot, der von einem Large Language Model angetrieben wird). Aber das ist kein Einmal-Ereignis. Das System nutzt eine clevere Strategie namens Monte Carlo Tree Search. Stellen Sie sich einen Detektiv vor, der ein Rätsel löst. Anstatt nur einem einzigen Verdacht zu folgen, probiert der Detektiv viele verschiedene Pfade aus. Wenn ein Pfad in einer Sackgasse endet, gibt er nicht auf, sondern kehrt zurück und versucht einen anderen Ansatz. Ähnlich verhält es sich mit Kernel Forge: Es schreibt nicht nur eine Version eines Rezepts und hofft das Beste. Es generiert viele Versionen, testet sie, und wenn eine langsam ist, versucht es sie zu korrigieren oder probiert einen völlig anderen Ansatz. Es führt einen „Stammbaum“ aller Versuche, wobei es sich merkt, welche Ansätze vielversprechend waren, selbst wenn sie anfangs nicht perfekt waren.
Die Ergebnisse: Schnelle Siege, aber nicht überall
Das Team testete Kernel Forge auf vier verschiedenen Arten von KI-Modellen: eines zur Bilderkennung (ResNet-50), eines zur Kunstgenerierung (Stable Diffusion 3.5 Medium) und zwei für Chatten und logisches Denken (Gemma 4 und Qwen 3.5). Sie führten diese Tests auf einem leistungsstarken Computer mit einer NVIDIA GB10 GPU durch.
Hier ist, was sie fanden heraus:
- Es funktioniert, aber es ist wählerisch: Das System konnte erfolgreich neue, schnellere Rezepte für viele Teile der KI generieren. In einigen Fällen war der von der KI geschriebene Code signifikant schneller als der Standardcode, den der Computer normalerweise verwendet. Beispielsweise war der neue Code für „Group Normalization“ im Bildgenerator 1,70-mal schneller. Im Chatbot Gemma 4 war der neue Code für „Softmax“ (ein mathematischer Schritt, der zur Entscheidungsfindung genutzt wird) ein massives 2,83-mal schneller.
- Das „bewachte“ Sicherheitsnetz: Das System ist sehr vorsichtig. Es besitzt einen „Wächter“, der jedes neue Rezept überprüft. Wenn das neue, von der KI geschriebene Rezept langsamer ist oder einen Fehler macht, wechselt das System sofort zum ursprünglichen, zuverlässigen Code zurück. Es erzwingt niemals ein schlechtes Rezept beim Nutzer. Das bedeutet, dass selbst wenn die KI versucht, einen Teil des Codes zu optimieren und scheitert, der Computer nicht abstürzt oder langsamer wird; er nutzt einfach die alte, sichere Methode.
- Die „großen Player“ sind schwer zu schlagen: Die Forscher stellten etwas Interessantes fest. Die Teile der KI, die die meiste Zeit beanspruchen (die „großen Player“), werden oft bereits von sehr ausgereiftem, von Experten geschriebenem Code von Unternehmen wie NVIDIA gehandhabt. Die KI hatte Mühe, diese Experten zu schlagen. Zum Beispiel war die „Linear“-Operation (die über 50 % der Zeit beansprucht) im Bildgenerator tatsächlich langsamer, als die KI versuchte, sie umzuschreiben. Das System entschied klug genug, für diesen Teil beim Originalcode zu bleiben.
- Kleine Siege summieren sich: Die größten Geschwindigkeitssteigerungen gab es bei den kleineren, weniger kritischen Teilen des Codes. Während die KI bei den größten Aufgaben die Experten nicht schlagen konnte, fand sie clevere Wege, die kleineren Aufgaben um das 1,5- bis 2,8-fache zu beschleunigen.
Die Kosten der Neugier
Die Forscher untersuchten auch, wie viel dieses „Nachdenken“ kostete. Sie nutzten ein leistungsstarkes KI-Modell, um den Code zu generieren, und jedes Mal, wenn die KI eine Zeile Code schrieb oder ein Ergebnis prüfte, kostete dies ein kleines bisschen Geld (basierend auf der API-Nutzung). Sie fanden heraus, dass die Kosten stiegen, je mehr Versuche (bis zu 50 Runden des Ausprobierens und Korrigierens) die KI unternahm. Die zusätzliche Geschwindigkeit, die sie dadurch gewannen, stand jedoch nicht immer im Verhältnis zu den zusätzlichen Kosten. Dies deutet darauf hin, dass wir, obwohl die KI großartige Abkürzungen finden kann, klug entscheiden müssen, wann wir die Suche stoppen sollten – besonders wenn der Teil des Codes, den wir zu reparieren versuchen, für die Gesamtgeschwindigkeit nicht so wichtig ist.
Das Fazbeurteilung (The Bottom Line)
Kernel Forge zeigt, dass wir in eine neue Ära eintreten, in der KI helfen kann, den Low-Level-Code zu schreiben, der andere KIs schneller macht. Es ist kein Zauberstab, der alles sofort löst; es kann die weltbesten menschlichen Experten bei den größten Aufgaben noch nicht leicht schlagen. Aber es ist ein mächtiges Werkzeug, das in der Lage ist, verborgene Geschwindigkeitsvorteile in den kleineren Details zu finden, während es das System gleichzeitig sicher und stabil hält.
Die Forscher haben ihr Tool als Open-Source veröffentlicht, was bedeutet, dass jeder es nutzen kann, um seine eigenen KI-Modelle schneller zu machen. Sie haben bewiesen, dass wir durch die Kombination der Kreativität von KI mit der Sicherheit von Realwelt-Tests damit beginnen können, die Motoren unserer digitalen Welt zu optimieren, ohne dafür einen PhD in Informatik zu benötigen. Es ist ein Schritt in Richtung einer Zukunft, in der unsere Computer nicht nur intelligenter, sondern auch viel effizienter sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.