← Neueste Arbeiten
💻 computer science

ContractBench: Can LLM Agents Preserve Observation Contracts?

Dieser Beitrag stellt ContractBench vor, einen deterministischen Benchmark, der zeigt, dass aktuelle Frontier-LLM-Agenten häufig die zeitliche Gültigkeit und die Byte-Level-Integrität von Beobachtungsverträgen (wie Sitzungstokens und URLs) nicht bewahren, eine Fähigkeit, die nicht monoton mit der Modellgröße skaliert und spezifisches fehlerbewusstes Training zur Verbesserung erfordert.

Ursprüngliche Autoren: Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: Das Problem des „digitalen Übergangs"

Stellen Sie sich vor, Sie stellen einen sehr klugen, aber etwas ungeschickten Roboter-Assistenten ein, der für Sie Besorgungen erledigt. Sie sagen dem Roboter: „Gehen Sie zur Bank, holen Sie sich einen vorübergehenden Schlüssel und benutzen Sie diesen Schlüssel, um den Safe zu öffnen."

In der realen Welt, wenn der Roboter den Schlüssel fallen lässt, die Form des Schlüssels verändert oder versucht, den Schlüssel zu benutzen, nachdem er abgelaufen ist, wird der Safe sich nicht öffnen. Der Roboter ist gescheitert, nicht weil er nicht wusste, was zu tun ist, sondern weil er es versäumt hat, die spezifischen Details des Übergangs zu handhaben.

Dieses Papier nennt diese Details „Beobachtungsverträge" (Observation Contracts).

  • Der Vertrag: Wenn ein Werkzeug (wie eine Bank-API) dem Roboter ein Stück Daten (wie ein temporäres Passwort oder einen signierten Link) gibt, sind mit diesen Daten zwei unsichtbare Regeln verbunden:
    1. Das Verfallsdatum: Sie müssen es jetzt benutzen, sonst wird es unbrauchbar.
    2. Die „Nicht anfassen"-Regel: Sie müssen es genau kopieren, Buchstabe für Buchstabe. Wenn Sie auch nur ein Komma oder ein Leerzeichen ändern, funktioniert es nicht.

Die Autoren stellten fest, dass selbst die klügsten KI-Agenten von heute schrecklich darin sind, diese Regeln zu befolgen. Sie lassen den Schlüssel oft fallen, schmelzen ihn oder versuchen, ihn am nächsten Tag zu benutzen.

Der neue Test: CONTRACTBENCH

Um dies zu beweisen, bauten die Forscher einen neuen Test namens CONTRACTBENCH auf. Denken Sie daran als an einen „Führerschein-Test" für KI-Agenten, aber anstatt ein Auto zu fahren, müssen sie einen digitalen Hindernisparcours bewältigen, bei dem jeder Schritt erfordert, ein zerbrechliches, zeitkritisches Paket an die nächste Person weiterzugeben.

  • Der Parcours: Er umfasst 33 verschiedene Szenarien (wie das Herunterladen einer Datei mit einem Link, der in 10 Sekunden abläuft, oder das Einloggen mit einem Code, der perfekt getippt werden muss).
  • Die Regeln: Der Test wird von einem strengen Computerprogramm durchgeführt (keine menschlichen Richter). Er verwendet eine „virtuelle Uhr", um zu sehen, ob der Agent zu langsam ist, und einen „digitalen Fingerabdruck-Scanner", um zu sehen, ob der Agent einen einzigen Buchstaben im Code verändert hat.
  • Die Punktzahl: Wenn der Agent das Zeitlimit überschreitet oder die Rechtschreibung des Codes vermasselt, besteht er nicht.

Was sie entdeckten (Die Ergebnisse)

Die Forscher testeten 38 verschiedene KI-Modelle (einschließlich der neuesten, berühmtesten von OpenAI, Anthropic, Google und Open-Source-Teams). Hier ist das, was sie fanden, in Alltagssprache übersetzt:

1. Selbst die „klügsten" Roboter scheitern

Das Ergebnis: Kein Modell bestand 80 % des Tests. Das beste (Claude Opus 4.6) erreichte nur etwa 78 %.
Die Analogie: Stellen Sie sich den klügsten Schüler der Welt vor, der einen Mathe-Test schreibt. Er kann komplexe Differentialgleichungen lösen, aber wenn Sie ihn bitten, eine 10-stellige Zahl perfekt abzuschreiben, ohne einen Tippfehler zu machen, liegt er immer noch 22 % der Zeit falsch. „Klug" zu sein bedeutet nicht, „vorsichtig" zu sein.

2. Die „magische Klippe" (Qwen 3.5)

Das Ergebnis: In einer bestimmten Modellfamilie (Qwen 3.5) gab es einen plötzlichen Sprung in der Fähigkeit. Das kleine 4-Milliarden-Parameter-Modell erreichte 0 % Korrektheit. Das etwas größere 9-Milliarden-Modell sprang auf 56 %.
Die Analogie: Es ist wie ein Videospiel-Charakter, der nutzlos ist, bis er Level 9 erreicht. Auf Level 8 kann er den Schlüssel nicht einmal halten. Auf Level 9 lernt er plötzlich, ihn sanft zu halten. Dies war keine langsame Verbesserung; es war ein plötzliches „Erwachen" einer spezifischen Fähigkeit namens Zurückhaltung (zu wissen, die Daten nicht zu verändern).

3. Größer ist nicht immer besser (Die GPT-5-Achterbahn)

Das Ergebnis: Während die GPT-5-Modellfamilie sich weiterentwickelte, stieg ihre Leistung an, stürzte dann ab und stieg wieder an.
Die Analogie: Stellen Sie sich einen Koch vor, der ein neues Rezeptbuch erhält.

  • Koch A (GPT-5): Backt einen perfekten Kuchen.
  • Koch B (GPT-5.1): Bekommt eine „klügere" Version des Buches, fängt aber an, zu viel Zucker hinzuzufügen und das Rezept zu ruinieren (speziell begannen sie, die Zutaten zu verändern, anstatt sie zu kopieren).
  • Koch C (GPT-5.2): Korrigiert das Rezept und backt wieder perfekte Kuchen.
    Das Papier legt nahe, dass das „klüger" oder „gesprächiger" machen einer KI sie manchmal schlechter darin macht, strenge, langweilige Regeln zu befolgen.

4. Die „Basis"-Modelle können es nicht

Das Ergebnis: Modelle, die nicht „trainiert" wurden, um zu chatten oder Anweisungen zu befolgen (Basis-Modelle), erreichten 0 % im Test. Nur Modelle, die gelernt hatten, Anweisungen zu befolgen (Instruct-Modelle), konnten bestehen.
Die Analogie: Ein roher Klumpen Ton (Basis-Modell) kann keine Form halten. Sie müssen ihn formen (Nachtraining), damit er ein Glas Wasser halten kann. Die Fähigkeit, diese Verträge zu befolgen, ist nicht natürlich; sie muss gelehrt werden.

5. Der „Hinweis" funktioniert

Das Ergebnis: Wenn die Forscher der KI genau sagten, was sie falsch gemacht hatte (z. B. „Sie haben einen Buchstaben im Code geändert"), konnte die KI ihren Fehler beheben und den Test bestehen.
Die Analogie: Wenn Sie einem Kind sagen: „Du hast den Ball fallen lassen", versucht es vielleicht erneut und fängt ihn. Aber wenn Sie nur sagen: „Versuch es nochmal", lassen sie ihn vielleicht wieder fallen. Das spezifische Feedback war der Schlüssel zur Fehlerbehebung.

Warum dies wichtig ist (laut dem Papier)

Das Papier argumentiert, dass wir KI bisher daran getestet haben, ob sie „ein Rätsel lösen" oder „eine Geschichte schreiben" kann. Aber in der realen Welt werden KI-Agenten oft für Aufgaben eingesetzt, bei denen Präzision alles ist.

Wenn ein KI-Agent Ihr Bankkonto verwaltet, darf er keine einzige Ziffer in einem Transaktionscode ändern. Wenn er einen Server verwaltet, darf er kein abgelaufenes Passwort verwenden.

Das Fazit: Aktuelle KI-Agenten sind wie brillante, aber ungeschickte Praktikanten. Sie verstehen das große Ganze, aber sie lassen ständig die zerbrechlichen Werkzeuge fallen, die sie erhalten. Um sie für reale Jobs zuverlässig zu machen, müssen wir aufhören, sie nur „klüger" zu machen, und anfangen, sie zu lehren, vorsichtiger und präziser mit den digitalen Verträgen umzugehen, die sie erhalten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →