Quantifying the Expectation-Realisation Gap for Agentic AI Systems
Die Studie belegt, dass Agentic-AI-Systeme in Bereichen wie Softwareentwicklung und klinischer Dokumentation systematisch hinter den Erwartungen zurückbleiben, da Integrationshemmnisse und Überprüfungsbelastungen zu erheblichen Produktivitätsverlusten führen, was strukturierte Planungsrahmen mit expliziten Nutzenprognosen und Berücksichtigung menschlicher Aufsichtskosten erfordert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
🚗 Der große Unterschied zwischen Versprechen und Realität: Wenn KI-Agenten auf die Probe gestellt werden
Stellen Sie sich vor, Sie kaufen einen neuen, hochmodernen Autopiloten für Ihr Auto. Der Verkäufer verspricht Ihnen: „Dieses System spart Ihnen auf jeder Fahrt 20 Minuten Zeit und fährt sicherer als Sie!" Sie freuen sich, investieren viel Geld und erwarten eine Revolution.
Aber was passiert, wenn Sie es wirklich auf die Straße bringen?
- Statt 20 Minuten sparen Sie vielleicht nur 2 Minuten.
- Oder schlimmer: Sie müssen so oft auf den Autopiloten achten, dass Sie sogar langsamer sind als vorher.
- Und manchmal fährt er sogar in die falsche Abzweigung, weil er die lokalen Straßenregeln nicht kennt.
Genau das beschreibt dieses Papier. Es untersucht den „Erwartungs-Realitäts-Lücke" (Expectation–Realisation Gap) bei agenter KI. Das sind KI-Systeme, die nicht nur Fragen beantworten, sondern eigenständig Aufgaben planen und ausführen (wie ein digitaler Assistent).
Hier ist die Geschichte, was wirklich passiert, wenn wir diese Systeme in der echten Welt einsetzen:
1. Die drei Schauplätze des Missgeschicks
Das Papier schaut sich drei Bereiche an, in denen wir große Hoffnungen auf KI setzen:
👨💻 Die Programmierer (Software-Entwicklung):
- Das Versprechen: Erfahrene Programmierer dachten, KI-Tools würden sie 24 % schneller machen.
- Die Realität: Sie wurden 19 % langsamer!
- Warum? Die KI schreibt Code, aber der Mensch muss ihn dann stundenlang prüfen, korrigieren und zusammenfügen. Es ist wie ein sehr schneller, aber unzuverlässiger Praktikant, der Ihnen mehr Arbeit macht, als er erledigt.
- Die Ironie: Nur bei sehr einfachen, klaren Aufgaben (wie ein kleines Spiel programmieren) half die KI wirklich. In komplexen, echten Projekten war sie eher ein Hindernis.
🩺 Die Ärzte (Klinische Dokumentation):
- Das Versprechen: KI-Schreiber (die mitreden und Notizen machen) sollen Ärzten 5 Minuten pro Patient sparen.
- Die Realität: In Tests wurden oft keine signifikanten Zeitersparnisse gemessen, oder es waren nur winzige Sekunden.
- Warum? Die KI macht Fehler. Der Arzt muss die Notizen lesen, korrigieren und manchmal ganz neu schreiben. Die Zeitersparnis wird durch die „Korrekturzeit" komplett aufgefressen. Zudem nutzen viele Ärzte das Tool gar nicht richtig, weil es zu umständlich in ihren Alltag passt.
🏥 Die Diagnose-Systeme (Klinische Entscheidungsunterstützung):
- Das Versprechen: KI sagt: „Ich erkenne Sepsis (Blutvergiftung) zu 80 % genau!"
- Die Realität: In echten Krankenhäusern lag die Genauigkeit oft nur bei 63 %.
- Warum? Im Labor (unter perfekten Bedingungen) sieht die KI toll aus. In der echten Welt mit unterschiedlichen Patienten und unvollständigen Daten versagt sie oft. Es ist wie ein Fußballspieler, der im Training Tore schießt, aber im echten Spiel gegen einen starken Gegner nicht trifft.
2. Warum fallen die Erwartungen so oft ins Wasser?
Das Papier nennt drei Hauptgründe, warum wir uns so täuschen lassen:
🔗 Der Klebe-Effekt (Workflow-Friction):
Stellen Sie sich vor, Sie fügen ein neues, riesiges Zahnrad in einen bestehenden Uhrwerksmechanismus ein. Es passt nicht perfekt. Die KI muss in den bestehenden Arbeitsablauf integriert werden. Oft klemmt es dort. Ärzte oder Programmierer müssen das Tool erst lernen, es anpassen oder es umgehen. Das kostet Zeit, die niemand eingeplant hat.🔍 Die Kontroll-Belastung (Verification Burden):
KI ist wie ein sehr schneller, aber manchmal fauler oder verwechselnder Assistent. Sie liefert Ergebnisse, aber niemand traut ihnen blind. Jeder muss das Ergebnis prüfen.- Beispiel: Wenn die KI einen Code schreibt, muss der Senior-Programmierer ihn prüfen. Wenn die KI eine Diagnose stellt, muss der Arzt sie bestätigen. Diese Prüfzeit wird oft vergessen, wenn man die „Zeitersparnis" berechnet.
📏 Das falsche Maßband (Mess-Problem):
Die Verkäufer messen mit einem anderen Maßband als die Realität.- Der Verkäufer sagt: „Wir sparen 5 Minuten pro Patient!" (Gemeint ist die reine Schreibzeit).
- Die Realität misst: „Wie viel Zeit hat der Arzt insgesamt für den Patienten gebraucht?" (Dazu zählen auch das Nachdenken, das Korrigieren der KI und das Warten).
Es ist wie wenn ein Lieferdienst sagt: „Wir liefern in 10 Minuten!" – aber das zählt nur die Fahrzeit, nicht die Zeit, die Sie brauchen, um das Paket zu öffnen und zu prüfen.
3. Nicht jeder profitiert gleich (Die Heterogenität)
Ein wichtiger Punkt: KI hilft nicht jedem.
- Bei Ärzten half die KI vor allem denen, die ohnehin sehr langsam und ineffizient schrieben. Die schnellen, erfahrenen Ärzte wurden eher langsamer.
- Bei Programmierern half die KI Anfängern bei einfachen Aufgaben, aber behinderte Experten bei komplexen Problemen.
- Die Metapher: Ein Regenschirm hilft jemandem, der im Regen steht. Aber wenn Sie schon einen riesigen, perfekten Schutzschirm haben, bringt Ihnen ein zweiter, kleinerer Schirm nichts – im Gegenteil, er ist nur im Weg.
4. Was sollten wir tun? (Die Lösung)
Das Papier sagt nicht: „KI ist schlecht." Es sagt: „Wir planen zu schlecht."
Statt blind auf Marketing-Versprechen zu hören, brauchen wir einen strukturierten Plan, ähnlich wie bei einem Bauprojekt:
- Seien Sie konkret: Nicht „wir sparen Zeit", sondern „wir sparen genau 30 Sekunden pro Aufgabe".
- Zählen Sie die Kosten: Rechnen Sie die Zeit für das Prüfen und Korrigieren der KI ab von der Zeit, die sie spart.
- Wer profitiert? Planen Sie nicht für „alle", sondern schauen Sie genau hin: Welcher Mitarbeiter oder welche Aufgabe profitiert wirklich?
- Vergleichen Sie: Messen Sie am Ende genau das, was Sie am Anfang versprochen haben.
Fazit
Die KI ist kein magischer Zauberstab, der alle Probleme löst. Sie ist eher wie ein sehr schneller, aber manchmal etwas chaotischer Praktikant. Wenn man ihn richtig einsetzt und ihm die richtige Anleitung gibt, kann er Wunder wirken. Wenn man ihm aber blind vertraut und die „Korrekturarbeit" vergisst, wird er uns eher bremsen als beschleunigen.
Der Schlüssel liegt nicht in der Technik selbst, sondern darin, realistisch zu planen und die Lücke zwischen dem, was wir hoffen, und dem, was passiert, ernst zu nehmen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.