Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems
Dieser Beitrag stellt Inductive Deductive Synthesis (IDS) vor, ein agenter LLM-System, das Implementierungen und formale Beweise für verteilte Systeme gemeinsam synthetisiert und bei Spezifikationen für Key-Value-Stores eine 100-prozentige Erfolgsquote erzielt, wobei die benötigte Zeit und die Kosten im Vergleich sowohl zu menschlichen Experten als auch zu den fortschrittlichsten Codierungsagenten erheblich reduziert werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bauen ein komplexes, verteiltes System wie eine digitale Bank oder ein gemeinsames Notizbuch, das viele Menschen gleichzeitig nutzen. Sie müssen sicherstellen, dass, wenn Person A eine Notiz schreibt, Person B sie sofort sieht, und dass keine Daten jemals verloren gehen oder durcheinander geraten, egal wie chaotisch das Internet wird.
Traditionell gibt es zwei Wege, dies zu bauen:
- Der „Raten und Prüfen"-Weg (Aktuelle KI): Sie bitten eine intelligente KI, den Code zu schreiben. Sie schreibt ihn, führt ein paar Tests durch und sagt: „Sieht gut aus!" Aber das ist wie das Prüfen einer Brücke, indem man ein einziges Auto darüber fährt. Sie könnte für dieses Auto halten, aber unter einem LKW einstürzen. Es garantiert keine Sicherheit für jedes mögliche Szenario.
- Der „Mathematische Beweis"-Weg (Traditionelle Experten): Sie stellen ein Team aus menschlichen Mathematikern und Ingenieuren ein. Sie testen den Code nicht nur; sie schreiben einen formalen mathematischen Beweis, dass der Code nicht versagen kann, egal was passiert. Das ist unglaublich sicher, erfordert aber jahrelange menschliche Arbeit und kostet ein Vermögen.
Das Problem:
Die Arbeit besagt, dass selbst die intelligentesten aktuellen KI-Agenten (wie Codex oder Claude) beim „Mathematischen Beweis"-Weg versagen. Sie versuchen, zuerst den Code zu schreiben und ihn dann später zu beweisen. Das ist wie der Versuch, ein Haus zu bauen und dann einen Architekten zu bitten, zu beweisen, dass es nicht einstürzen wird, nachdem die Ziegel bereits verlegt sind. Das ist zu schwierig, und sie bleiben stecken.
Die Lösung: Induktive Deduktive Synthese (IDS)
Die Autoren haben ein neues KI-System namens IDS (Inductive Deductive Synthesis) entwickelt. Betrachten Sie IDS nicht als einzelne Arbeitskraft, sondern als ein Team spezialisierter Architekten und Inspektoren, die in einer engen Schleife arbeiten.
So funktioniert es, mit einer einfachen Analogie:
Die „Bauen und Inspektieren"-Schleife
Anstatt das ganze Haus zu bauen und es dann zu überprüfen, baut IDS ein winziges Stück des Hauses und prüft sofort, ob dieses winzige Stück mathematisch fundiert ist.
- Das Deduktive Team (Die Bauarbeiter): Diese KI-Agenten versuchen, ein kleines Stück Code (wie einen Türrahmen) und ein kleines Stück des Beweises (einen mathematischen Satz, der besagt: „Dieser Türrahmen ist stabil") zu schreiben.
- Der Inspektor (Der Beweis-Assistent): Ein strenger, unblinzelnder Roboter-Inspektor (genannt Rocq) überprüft die Arbeit sofort.
- Wenn die Mathematik nicht aufgeht, sagt der Inspektor: „Nein, dieser Türrahmen ist schwach", und das Team stoppt sofort. Sie verschwenden keine Zeit damit, den Rest des Hauses auf einem schwachen Fundament zu bauen.
- Wenn es besteht, gehen sie zum nächsten winzigen Stück über.
- Das Induktive Team (Die Strategen): Manchmal bleiben die Bauarbeiter stecken. Sie versuchen immer wieder, denselben Typ Tür zu bauen, aber die Mathematik funktioniert nie. Hier kommt der „induktive" Teil ins Spiel.
- Der Vorschlagende: Ein strategischer KI-Blickt auf den steckengebliebenen Punkt und sagt: „Hey, vielleicht sollten wir keine Holztür bauen; versuchen wir eine aus Stahl." Es schlägt eine neue lokale Lösung vor.
- Der Neustarter: Wenn die gesamte Strategie falsch ist (wie der Versuch, ein Haus auf einem Sumpf zu bauen), sagt dieser Strategist: „Schmeißt dieses Design weg. Fangen wir mit einem völlig anderen Bauplan von vorne an."
Warum das eine große Sache ist
Die Arbeit behauptet, dieses System sei aus drei Gründen ein Game-Changer:
- Geschwindigkeit: Es löste 7 verschiedene komplexe Probleme verteilter Systeme in etwa 6,8 Stunden. Ein Team menschlicher Experten hätte für dasselbe Monate oder Jahre gebraucht. Das ist ungefähr 200-mal schneller.
- Erfolgsquote: Die besten bestehenden KI-Agenten konnten nur 2 von 7 dieser Probleme lösen. IDS löste alle 7.
- Leistung: Nicht nur ist der Code korrekt, sondern er ist auch schnell. In einigen Fällen lief der von IDS generierte Code 3-mal schneller als die besten von Menschen geschriebenen Versionen. Dies geschah, weil die KI mehr Designoptionen erkundete als ein Mensch normalerweise würde, und dabei einen „Sweet Spot" fand, den Menschen übersehen hatten.
Der Haken (Einschränkungen)
Die Arbeit ist sehr ehrlich darüber, was IDS noch nicht kann:
- Es braucht ein perfektes Rezept: Sie benötigen immer noch einen menschlichen Experten, um die initiale „Spezifikation" (die mathematischen Regeln dafür, was das System tun soll) zu schreiben. Wenn das Rezept falsch ist, baut die KI ein perfektes Haus, das nicht dem entspricht, was Sie wollten.
- Es ist noch kein Zauberstab für alles: Sie testeten es spezifisch auf „Key-Value Stores" (eine Art Datenbank). Obwohl sie glauben, dass es bei anderen Dingen funktionieren könnte (wie Betriebssysteme oder Verschlüsselung), haben sie dies noch nicht bewiesen.
Das Fazit
Diese Arbeit stellt eine neue Art vor, KI einzusetzen, die Bauen und Prüfen gleichzeitig kombiniert. Anstatt die KI zu bitten, „Code zu schreiben und zu hoffen, dass er funktioniert", bittet sie die KI, „Code zu schreiben und zu beweisen, dass er funktioniert, Schritt für Schritt".
Sie verwandelt den Prozess der Erstellung „perfekt sicherer" Software von einem langsamen, teuren menschlichen Marathon in einen schnellen, automatisierten Sprint und macht die Software, auf die wir uns verlassen (wie Banking-Apps oder Cloud-Speicher), potenziell viel sicherer und zuverlässiger.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.