← Neueste Arbeiten
⚛️ phenomenology

LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning

Diese Arbeit thematisiert die mangelnde KI-Unterstützung für die symbolische Manipulationssprache FORM, indem sie aufzeigt, dass Frontier-Large-Language-Modelle bei Zero-Shot-FORM-Aufgaben versagen, und führt anschließend eine verifikationsgesteuerte Fine-Tuning-Pipeline unter Verwendung der FORM-Binärdatei als Oracle ein, um ein kompaktes Modell mit 8 Milliarden Parametern zu trainieren, das deutlich größere Frontier-Modelle in der Code-Ausführung und Korrektheit übertrifft, während es gleichzeitig allgemeine Denkfähigkeiten bewahrt.

Ursprüngliche Autoren: Bakar Chargeishvili

Veröffentlicht 2026-09-22
📖 4 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bakar Chargeishvili

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der subatomaren Welt, in der Teilchen in Bruchteilen einer Sekunde kollidieren und zerfallen, verlassen sich theoretische Physiker auf eine spezialisierte Sprache, um die Mathematik ihrer Entdeckungen zu beschreiben. Diese Sprache namens Form ist kein Allzweck-Programmierwerkzeug, sondern ein hochspezialisiertes System, das darauf ausgelegt ist, algebraische Ausdrücke von überwältigender Komplexität zu handhaben. Wenn Wissenschaftler das Verhalten von Teilchen mittels Quantenfeldtheorie berechnen, können die resultierenden Formeln Millionen oder gar Milliarden von Termen enthalten. Allgemeine Computerprogramme stürzen oft ab, wenn sie mit solch massiven Berechnungen konfrontiert werden, aber Form ist darauf ausgelegt, diese zu bewältigen, indem es Zwischenschritte auf einer Festplatte statt im Arbeitsspeicher des Computers speichert. Seit Jahrzehnten ist dieses Werkzeug unverzichtbar für die Entschlüsselung der Geheimnisse des Universums, doch es bleibt schwer zu erlernen. Seine Syntax ist einzigartig, seine Regeln sind unnachgiebig, und bis jetzt gab es keine künstliche Intelligenz, die in der Lage war, einem Menschen beim Schreiben von Code dafür zu helfen.

Diese technologische Lücke stellte die Forscher am Karlsruher Institut für Technologie vor eine einzigartige Herausforderung. Sie stellten eine grundlegende Frage: Könnte eine moderne künstliche Intelligenz, die auf riesigen Mengen von Internetdaten trainiert wurde, lernen, Code für eine Sprache zu schreiben, die in diesen Daten kaum existiert? Die Antwort, die sie fanden, war ein definitives Nein. Als sie die leistungsfähigsten, modernsten KI-Modelle testeten – einige davon mit Hunderten von Milliarden Parametern –, scheiterten diese Giganten der künstlichen Intelligenz vollständig. Ohne ein Handbuch oder eine Anleitung, auf die sie zurückgreifen konnten, waren sie nicht in der Lage, auch nur eine einzige Zeile gültigen Form-Code zu generieren. Für die KI war diese Sprache praktisch unsichtbar, ein Bereich mit Null-Ressourcen, in dem die schiere Größe des Modells weniger entscheidend war als das Fehlen spezifischer Trainingsdaten.

Um dies zu lösen, wählten die Forscher einen anderen Ansatz. Anstatt sich auf ein massives Modell zu verlassen, das die Regeln errät, bauten sie eine spezialisierte, kleinere KI und trainierten sie mithilfe einer rigorosen, selbstkorrigierenden Methode. Sie entwickelten eine Pipeline, in der eine leistungsstarke KI Kandidatenprogramme basierend auf einfachen englischen Anweisungen generierte, diese Programme jedoch nicht sofort als korrekt akzeptiert wurden. Stattdessen wurden sie in die eigentliche Form-Software eingespeist, um zu prüfen, ob sie korrekt liefen. Wenn der Code einen Fehler verursachte oder ein falsches Ergebnis lieferte, wurde er verworfen. Nur die Programme, die jede Prüfung – Syntax, Ausführung und logische Konsistenz – bestanden, wurden beibehalten. Dieser Prozess generierte eine verifizierte Bibliothek von über 4.600 Beispielen, die von einfachen Tutorials bis hin zu komplexen physikalischen Berechnungen reichten.

Unter Verwendung dieser hochwertigen, verifizierten Daten verfeinerten das Team ein kompaktes KI-Modell mit acht Milliarden Parametern. Das Ergebnis war ein Spezialist, der die größten und teuersten Modelle der Welt übertraf. Bei einem Satz von 664 spezifischen Berechnungsaufgaben löste dieses kleine, spezialisierte Modell 97,7 % davon korrekt. Im Gegensatz dazu schafften es die größten Frontier-Modelle, selbst wenn ihnen eine Syntax-Anleitung zum Lesen gegeben wurde, nur bei etwa 75 % derselben Aufgaben syntaktisch gültigen Code zu generieren, der ohne Fehler durchlief. Der Vorteil war bei offenen Aufgaben, bei denen das Ziel zwar beschrieben, die Methode jedoch nicht spezifiziert war, noch ausgeprägter: Das spezialisierte Modell generierte in 83 % der Fälle ausführbaren Code, während die besten der riesigen Modelle dies nur in 65 % der Fälle schafften.

Vielleicht am überraschendsten war die Erkenntnis der Forscher, dass dieses spezialisierte Training nicht dazu führte, dass die KI „vergaß“, wie man andere Dinge tut. Das Modell behielt seine allgemeinen Denk- und Programmierfähigkeiten bei und zeigte nur einen minimalen Leistungsabfall bei Standardtests für Mathematik und Logik. Dies deutet darauf hin, dass das Lehren einer neuen, nischigen Fähigkeit an eine KI nicht die Aufgabe erfordert, ihre allgemeine Intelligenz zu opfern. Die Studie zeigt, dass es bei hochspezialisierten wissenschaftlichen Sprachen nicht auf die schiere Größe des Modells ankommt, sondern auf die Qualität und Verifizierung der Daten, aus denen es lernt. Indem sie die Software selbst als Lehrer einsetzten, um jede Lektion zu verifizieren, schufen die Forscher ein Werkzeug, das nun Physiker dabei unterstützen kann, den komplexen Code zu schreiben, der zur Erforschung der fundamentalen Naturgesetze nötig ist, und damit die Eintrittsbarriere für eine Sprache senken, die lange Zeit ein Engpass in der Hochenergiephysik war.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →