Governance by Construction for Generalist Agents
Dieser Beitrag stellt CUGA vor, ein modulares Policy-as-Code-System, das Governance direkt in die Ausführungspipeline von Generalist-LLM-Agenten durch fünf strukturelle Prüfpunkte integriert und so sichere, überprüfbare und konforme autonome Operationen in Unternehmensumgebungen ohne Notwendigkeit einer Modellfeinabstimmung ermöglicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie stellen einen brillanten, superschnellen, aber leicht chaotischen persönlichen Assistenten ein, um Ihr Unternehmen zu führen. Dieser Assistent (der „Generalist-Agent") ist unglaublich intelligent und kann lernen, fast jedes Werkzeug in Ihrem Büro zu nutzen, von Ihrer E-Mail bis hin zu Ihrer Bankdatenbank. Da er jedoch so hilfsbereit ist, könnte er versehentlich die falschen Dateien löschen, geheime Passwörter weitergeben oder versuchen, Dinge zu tun, die gegen Unternehmensregeln verstoßen.
Die Arbeit „Governance by Construction for Generalist Agents" stellt eine Lösung namens CUGA vor. Betrachten Sie CUGA nicht als Weg, den Assistenten neu zu trainieren, um „besser" zu sein, sondern als einen intelligenten, unsichtbaren Sicherheitsgurt, den Sie ihm anlegen, bevor er mit der Arbeit beginnt. Dieser Gurt verändert nicht, wie der Assistent denkt; er stellt lediglich sicher, dass er die Regeln während des Denkens und Handelns einhält.
So funktioniert dieser „Sicherheitsgurt", aufgeteilt in fünf einfache Kontrollpunkte:
1. Der Türsteher an der Tür (Intent Guard)
Bevor der Assistent überhaupt ein Werkzeug in die Hand nimmt, prüft der Intent Guard, was er zu tun versucht.
- Die Analogie: Stellen Sie sich einen Türsteher in einem Club vor. Wenn Sie versuchen, mit einer Waffe oder einem gefälschten Ausweis hineinzukommen, hält Sie der Türsteher sofort auf.
- In der Arbeit: Wenn ein Benutzer den Agenten auffordert, „jeden Kontakt in der Datenbank zu löschen", erkennt der Türsteher diese gefährliche Anfrage und schließt die Tür sofort. Der Agent erhält nie einmal die Gelegenheit, darüber nachzudenken, wie er dies tun könnte.
2. Das schrittweise Rezept (Playbook)
Sobald der Agent drinnen ist, gibt ihm das Playbook ein spezifisches Rezept für komplexe Aufgaben vor.
- Die Analogie: Anstatt einem Koch zu erlauben, zu raten, wie man einen Soufflé macht, geben Sie ihm eine strenge Rezeptkarte mit der Aufschrift: „Zuerst Eier verquirlen. Zweitens Ofen vorheizen. Drittens Temperatur prüfen."
- In der Arbeit: Wenn ein Benutzer darum bittet, „einen Arzt zu finden", rät der Agent nicht einfach. Das Playbook zwingt ihn, eine strenge Abfolge einzuhalten: zuerst die Versicherung prüfen, dann den Arztcodes nachschlagen und schließlich die Liste durchsuchen. Dies verhindert, dass der Agent Schritte überspringt oder Fakten erfindet.
3. Das Werkzeughandbuch (Tool Guide)
Wenn der Agent ein Werkzeug aufgreift (wie eine Datenbank oder eine Suchmaschine), aktualisiert der Tool Guide das Handbuch, das er liest.
- Die Analogie: Stellen Sie sich vor, Sie verwenden einen Akkubohrschrauber. Der Tool Guide ist wie ein Haftnotizzettel auf dem Bohrer mit der Aufschrift: „Warnung: Nicht auf nassem Holz verwenden, und immer eine Schutzbrille tragen."
- In der Arbeit: Er fügt den vom Agenten verwendeten Werkzeugen zusätzliche Anweisungen hinzu, erinnert sie an Sicherheitsregeln oder spezifische Methoden zur korrekten Verwendung des Werkzeugs und stellt sicher, dass sie es nicht missbrauchen.
4. Der menschliche „Pause"-Knopf (Tool Approval)
Für gefährliche Aktionen drückt das System einen Pause-Knopf und wartet auf das „Go" eines menschlichen Chefs.
- Die Analogie: Es ist wie bei einem Videospiel, in dem das Spiel einfriert und fragt, wenn Sie versuchen, eine Brücke zu sprengen: „Sind Sie sicher, dass Sie dies tun möchten? Drücken Sie 'Ja', um fortzufahren."
- In der Arbeit: Wenn der Agent versucht, eine Datenbank zu löschen oder eine sensible E-Mail zu senden, hält das System an. Ein Mensch muss explizit auf „Genehmigen" klicken, bevor die Aktion ausgeführt wird. Dies verhindert versehentliche Zerstörung.
5. Der Redakteur (Output Formatter)
Schließlich prüft der Output Formatter die endgültige Nachricht, bevor der Assistent die Antwort an Sie zurücksendet.
- Die Analogie: Es ist wie ein Redakteur, der einen Rohentwurf nimmt, sicherstellt, dass er korrekt formatiert ist, versehentliche Tippfehler entfernt und dafür sorgt, dass er professionell aussieht.
- In der Arbeit: Er stellt sicher, dass die endgültige Antwort gut strukturiert ist (wie eine Tabelle oder eine klare Liste) und filtert alle Informationen heraus, die nicht geteilt werden sollten.
Warum dies wichtig ist (Die Ergebnisse)
Die Autoren testeten dieses System in zwei realen Geschäftsszenarien:
- Gesundheitswesen: Ärzte finden und Versicherungen prüfen.
- Geschäftsbetrieb: Komplexe Back-Office-Aufgaben bearbeiten.
Sie stellten fest, dass die Agenten bei der Hinzufügung dieses „Sicherheitsgurts" zu verschiedenen KI-Modellen (einschließlich quelloffener Modelle) deutlich besser in ihrer Arbeit wurden.
- Ohne das System machten die Agenten Fehler, übersprangen Schritte oder gerieten in Verwirrung.
- Mit dem System befolgten die Agenten die Regeln perfekt. In einem Test stieg die Erfolgsrate von 75 % auf 100 %.
Die große Erkenntnis
Die Hauptidee dieser Arbeit ist, dass Sie kein „perfektes" KI-System von Grund auf neu bauen müssen, um es sicher zu machen. Stattdessen können Sie ein Governance-System aufbauen, das um die KI herum sitzt, Fehler auffängt und Regeln in jedem einzelnen Schritt des Prozesses durchsetzt. Dies macht es sicher, leistungsstarke KI-Agenten in realen Unternehmen einzusetzen, ohne befürchten zu müssen, dass sie versehentlich etwas zerstören oder Geheimnisse preisgeben. Es verwandelt einen „Wildcard"-Assistenten in einen zuverlässigen, regelkonformen Mitarbeiter.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.