AutomationBench
Das Paper stellt AutomationBench vor, einen neuen Benchmark, der KI-Agenten anhand realer, plattformübergreifender Geschäftsworkflows bewertet, bei denen sie eigenständig API-Endpunkte entdecken, Geschäftsregeln befolgen und Daten korrekt in verschiedenen Systemen ablegen müssen, wobei aktuelle Spitzenmodelle dabei noch unter 10 % liegen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stell dir vor, du bist der Chef eines riesigen, chaotischen Büros. In diesem Büro arbeiten nicht nur Menschen, sondern auch viele verschiedene digitale Assistenten: einer kümmert sich um E-Mails, einer um den Kalender, einer um die Kundendatenbank (CRM) und noch einer um das Chat-Programm.
Bisher waren die Tests für künstliche Intelligenz (KI) wie ein Einzelsport-Wettkampf. Man hat der KI eine Aufgabe gegeben, die nur in einem dieser Programme stattfand. Zum Beispiel: „Schreibe eine E-Mail an Herrn Müller." Das war einfach.
Das neue Papier von Daniel Shepard und Robin Salimans (von Zapier) stellt jedoch eine völlig andere Herausforderung vor: AutomationBench.
Was ist AutomationBench?
Stell dir AutomationBench wie einen großen, komplexen Kochwettbewerb vor, bei dem der KI-Koch nicht nur in einer Küche arbeiten darf, sondern gleichzeitig in drei verschiedenen Restaurants.
- Der Auftrag: „Koch ein Gericht, das aus Zutaten besteht, die du erst finden musst. Du musst im Restaurant A (CRM) nach einem Kunden suchen, im Restaurant B (Kalender) einen Termin prüfen, im Restaurant C (E-Mail) eine Nachricht senden und dabei strikte Regeln befolgen, die in einem alten Kochbuch (Richtlinien-Dokument) stehen."
- Die Herausforderung: Die KI weiß nicht, wo die Zutaten liegen. Sie muss selbst herausfinden, welche Tür sie öffnen muss (API-Endpunkte entdecken). Sie muss entscheiden, welche Zutaten wichtig sind und welche nur Ablenkung (Distraktoren). Und sie darf keine Regeln brechen, selbst wenn es logischer erscheint, sie zu ignorieren.
- Die Bewertung: Es ist egal, wie der Koch gekocht hat. Es zählt nur das Ergebnis auf dem Teller. War das Essen fertig? War es richtig gewürzt? War es beim richtigen Gast? Wenn die KI den Teller falsch serviert hat, hat sie verloren – egal wie kreativ sie gekocht hat.
Warum ist das so schwer?
Die Autoren sagen: „Selbst die klügsten KIs der Welt (die sogenannten 'Frontier-Modelle') schaffen es aktuell kaum, 10 % dieser Aufgaben richtig zu lösen."
Warum? Weil die Aufgaben wie ein Labyrinth mit Irrgärten sind:
- Versteckte Hinweise: Die KI muss erst herausfinden, wo die Informationen überhaupt stehen. Oft denkt sie, die Daten sind im Kalender, aber sie liegen eigentlich in einer Excel-Tabelle.
- Falsche Freunde: Es gibt viele Daten, die wie die richtigen aussehen, aber falsch sind (wie Köpfe im Getreidefeld).
- Strenge Regeln: Manchmal sagt der Chef: „Wenn es regnet, mach das anders." Die KI muss diese Regel lesen und befolgen, auch wenn sie intuitiv etwas anderes tun würde.
Was haben die Tests ergeben?
Die Ergebnisse sind wie eine Schreckensmeldung für die KI-Industrie, aber auch eine klare Landkarte für die Zukunft:
- Die Besten sind noch nicht gut genug: Der aktuell stärkste KI-Modell (Opus 4.7) schafft nur etwa 9,9 % der Aufgaben. Das ist wie ein Schüler, der bei einer Matheprüfung nur 10 von 100 Punkten bekommt.
- Unterschiedliche Stärken: Manche KIs sind gut darin, E-Mails zu schreiben, aber schlecht darin, Termine zu prüfen. Andere sind schnell, aber machen viele Fehler. Es gibt keine „Allround-Meisterin".
- Kostenfalle: Manche Modelle versuchen es so oft und so wild, dass sie am Ende zwar die Aufgabe lösen, aber so viele „Schritte" (und damit Geld) verbrauchen, dass es sich für Unternehmen nicht lohnt.
Die große Bedeutung
Warum machen wir das? Weil Unternehmen nicht wollen, dass eine KI nur eine E-Mail schreibt. Sie wollen, dass eine KI einen ganzen Prozess übernimmt:
- Ein Kunde ruft an -> Die KI sucht den Kunden in der Datenbank -> Prüft, ob er noch im Projekt ist -> Erstellt einen Termin im Kalender -> Schickt eine Bestätigung per E-Mail -> Aktualisiert die Finanzdaten.
Bisher mussten Menschen diese Brücken zwischen den verschiedenen Programmen bauen. AutomationBench zeigt uns: Wir sind noch weit davon entfernt, dass KIs das allein und fehlerfrei erledigen können.
Fazit in einem Satz
AutomationBench ist wie ein realistischer Stress-Test für digitale Assistenten: Es zeigt uns, dass unsere heutigen KIs zwar toll darin sind, einzelne Dinge zu tun, aber noch völlig überfordert sind, wenn sie komplexe, vernetzte Büro-Aufgaben eigenständig und fehlerfrei erledigen sollen. Es ist der Maßstab, an dem wir messen, ob KI wirklich bereit ist, die Arbeitswelt zu revolutionieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.