← Neueste Arbeiten
💻 computer science

Event-B Agent: Towards LLM Agent for Formal Model Synthesis and Repair

Das Papier stellt Event-B Agent vor, ein neuartiges Framework, das große Sprachmodelle nutzt, um durch abwechselnde Verfeinerung und Verifikation schrittweise Event-B-Formalmodelle zu synthetisieren und zu reparieren und dadurch die End-to-End-Generierung korrekter, konstruktionsbasierter Software aus natürlichen Sprachanforderungen erheblich verbessert.

Ursprüngliche Autoren: Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen Wolkenkratzer zu bauen, aber anstatt Baupläne und Bauarbeiter zu verwenden, bitten Sie einen sehr klugen, gut gebildeten, aber gelegentlich verwirrten Architekten (eine KI), das gesamte Gebäude aus einer einfachen verbalen Beschreibung zu entwerfen.

Das Problem ist, dass dieser KI-Architekt hervorragend darin ist, Worte zu schreiben, aber schrecklich in Mathematik und Logik. Wenn Sie ihn bitten, eine Brücke zu entwerfen, könnte er eine schöne Beschreibung verfassen, aber die Mathematik hinter den Stützen könnte falsch sein. In der realen Welt stürzt eine Brücke mit falscher Mathematik zusammen. In der Software führt eine falsche Mathematik dazu, dass das System abstürzt oder sich unvorhersehbar verhält.

Dies ist die Herausforderung der Formalen Methoden: eine Möglichkeit, Software unter Verwendung strenger mathematischer Regeln zu entwickeln, um zu beweisen, dass sie funktioniert, bevor sie jemals ausgeführt wird. Doch es ist so schwierig und erfordert so viel mathematische Expertise, dass nur sehr wenige Menschen sie anwenden.

Hier kommt „Event-B Agent" ins Spiel.

Die Arbeit stellt ein neues System namens Event-B Agent vor. Betrachten Sie es nicht nur als Schreiber, sondern als ein kollaboratives Bauteam, das den KI-Architekten, einen strengen Bauinspektor und eine Reparaturcrew umfasst, die alle in einer Schleife zusammenarbeiten.

So funktioniert es, aufgeschlüsselt in einfache Schritte:

1. Die „Schritt-für-Schritt"-Strategie (Verfeinerung)

Wenn Sie die KI bitten, den gesamten Wolkenkratzer auf einmal zu bauen, wird sie überwältigt sein und Fehler machen.

  • Die Analogie: Stellen Sie sich vor, Sie bauen ein Haus. Sie versuchen nicht, das Dach, die Wasserleitungen, die elektrische Verkabelung und das Fundament in einem einzigen riesigen Absatz zu entwerfen. Sie tun es in Schichten. Zuerst zeichnen Sie eine grobe Skizze der Form. Dann fügen Sie Wände hinzu. Dann fügen Sie Fenster hinzu.
  • Was der Agent tut: Er zerlegt die große, beängstigende Anforderung („Bauen Sie ein System, das die niedrigste Zahl findet") in kleine, handhabbare Teile. Er erstellt zuerst eine einfache „abstrakte" Version, beweist, dass diese Version funktioniert, und dann fügt er mehr Details hinzu. Dies nennt man Verfeinerung. Es ist wie das Schälen einer Zwiebel; Sie bewältigen eine Schicht nach der anderen und stellen sicher, dass jede Schicht solide ist, bevor Sie zur nächsten übergehen.

2. Der „Strengen Inspektor" (Formale Verifikation)

Sobald die KI eine Schicht des Gebäudes gezeichnet hat, geht sie nicht einfach davon aus, dass sie gut ist.

  • Die Analogie: Stellen Sie sich einen superstrengen Bauinspektor vor, der nicht nur die Baupläne betrachtet; er führt eine Simulation durch. Er prüft: „Wenn es regnet, wird das Dach dann undicht?" „Wenn der Aufzug nach unten fährt, werden die Seile reißen?"
  • Was der Agent tut: Er verwendet zwei Arten von Inspektoren:
    1. Der Modellprüfer: Dieser prüft das Design gegen spezifische Szenarien (wie das Testen eines Autos im Windkanal). Er findet Fehler schnell, aber nur innerhalb eines begrenzten Bereichs.
    2. Der Theorembeweiser: Dies ist der ultimative Logiker. Er versucht, mathematisch zu beweisen, dass das Design für jedes mögliche Szenario, für immer, perfekt ist.
      Wenn einer der beiden Inspektoren ein Problem findet, wird das Gebäude nicht genehmigt.

3. Die „Reparaturcrew" (Modell- und Beweisreparatur)

Dies ist der magische Teil. In der Vergangenheit, wenn der Inspektor einen Fehler fand, würde die KI einfach stecken bleiben oder aufgeben.

  • Die Analogie: Stellen Sie sich vor, der Inspektor sagt: „Ihr Türrahmen ist zu schwach." Eine normale KI könnte einfach sagen: „Oh, okay," und aufhören. Aber Event-B Agent hat eine Reparaturcrew. Die Crew betrachtet den Bericht des Inspektors, findet heraus, warum die Tür schwach ist, und schlägt spezifische Reparaturen vor: „Lassen Sie uns hier einen Stahlträger hinzufügen" oder „Lassen Sie uns das Holz durch Metall ersetzen."
  • Was der Agent tut: Wenn die Mathematik versagt, rät der Agent nicht einfach. Er betrachtet die spezifische Fehlermeldung (die „Beweisverpflichtung"). Er verfügt über eine Bibliothek von „Reparaturregeln" (wie ein Mechanikerhandbuch). Er könnte sagen: „Die Mathematik sagt, dass diese Variable null sein könnte, was einen Divisionsfehler verursacht. Lassen Sie uns eine Regel hinzufügen, die besagt: 'Diese Variable muss größer als null sein'."
    Anschließend aktualisiert er das Design und den Beweis gleichzeitig. Er wiederholt diese Schleife – Entwurf, Prüfung, Reparatur, Prüfung, Reparatur – bis der Inspektor einen Daumen hoch gibt.

Warum ist das eine große Sache?

Die Arbeit testete dies an 27 verschiedenen komplexen Systemen (wie Algorithmen zur Suche von Daten oder zur Steuerung von Ampeln). Sie verglichen Event-B Agent mit anderen KI-Tools, die nur versuchen, Code zu schreiben oder ihn einmalig zu prüfen.

  • Das Ergebnis: Event-B Agent war viel besser darin, Systeme zu entwickeln, die tatsächlich korrekt waren. Es konnte erfolgreich beweisen, dass seine Entwürfe etwa 98 % der Zeit funktionierten, während andere Methoden mit komplexer Mathematik kämpften und oft Fehler zurückließen.
  • Die Effizienz: Es dauerte nicht ewig. Es konnte ein komplexes System in etwa eine Stunde und fünfzehn Minuten reparieren, was im Vergleich zu einem menschlichen Experten, der für dieselbe Mathematik Tage oder Wochen benötigen könnte, unglaublich schnell ist.

Das Fazit

Event-B Agent ist ein Werkzeug, das KI beibringt, Software zu entwickeln, die „durch Konstruktion korrekt" ist. Dies erreicht es durch:

  1. Das Aufteilen großer Probleme in kleine, einfache Schritte.
  2. Die Verwendung strenger mathematischer Inspektoren, um jeden einzelnen Fehler zu finden.
  3. Das Vorhandensein einer intelligenten Reparaturcrew, die das Design und den mathematischen Beweis gemeinsam repariert, bis alles perfekt ist.

Es ist, als würde man einem Roboter einen Bauplan, einen Taschenrechner und einen Hammer geben und ihm sagen: „Hör nicht auf, bis du mathematisch beweisen kannst, dass dieses Gebäude niemals einstürzen wird." Die Arbeit zeigt, dass dieser Ansatz viel besser funktioniert als nur den Roboter zu bitten, „einen Code zu schreiben".

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →