BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data
BatchDAG ist ein skalierbares System, das LLMs nutzt, um typisierte gerichtete azyklische Graphen zur Orchestrierung paralleler, entitätenspezifischer Batch-Operationen zu generieren, was eine effiziente und präzise Ad-hoc-Analyse über große Unternehmensdatensätze ermöglicht und dabei Halluzinationen sowie Kosten im Vergleich zu sequenziellen Agenten-Ansätzen signifikant reduziert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie hätten einen superintelligenten Roboter-Freund, der ein einzelnes Buch lesen und Ihnen genau sagen kann, was darin passiert ist. Dieser Roboter ist großartig darin, eine einzelne Geschichte zusammenzufassen, aber was wäre, wenn Sie ihn bitten würden, 50.000 Bücher zu lesen und eine Frage zu beantworten wie: „Hat jeder einzelne Charakter in diesen Büchern jemals über Geld gesprochen?“ Wenn Sie dem Roboter einfach alle Bücher auf einmal übergeben würden, würde sein Gehirn vor zu vielen Informationen explodieren. Wenn Sie ihn bitten würden, sie nacheinander zu lesen, würde es Jahre dauern, bis er fertig ist. Dies ist das Problem, vor dem moderne „Large Language Models“ (LLMs) stehen – die KI-Gehirne hinter vielen Chatbots. Sie sind brillant darin, einzelne Dokumente zu verstehen, aber sie haben Schwierigkeiten, wenn sie gebeten werden, massive, unordentliche Datensammlungen (wie tausende von Geschäftstreffen) auf einmal zu analysieren. Sie werden verwirrt, verlieren den Überblick darüber, welcher Fakt zu welchem Treffen gehört, und brauchen ewig, um fertig zu werden.
Hier kommt BatchDAG ins Spiel, ein neues System, das darauf ausgelegt ist, dies zu lösen, indem es wie ein Meisterdirigent eines riesigen Orchesters agiert. Anstatt den KI-Roboter alles selbst machen zu lassen, nutzt BatchDAG die KI nur, um ein detailliertes „Rezept“ oder eine „Karte“ dessen zu schreiben, was getan werden muss. Dann folgt eine superschnelle, nicht-denkende Computer-Engine dieser Karte, erledigt die langweilige, repetitive Mathematik und die Suche augenblicklich und ruft die „kluge“ KI nur dann an, wenn es absolut notwendig ist. Das Ergebnis? Das System kann komplexe Fragen über zehntausende von Meetings in weniger als einer Minute beantworten, kostet Centbeträge statt Dollar und erfindet keine Fakten.
Das Problem: Die „Ein-nach-dem-anderen“-Falle
Denken Sie daran, wie man versucht, ein spezifisches Gespräch in einer Bibliothek von 50.000 Besprechungsprotokollen zu finden. Wenn Sie einen Standard-KI-Agenten verwenden (wie einen ReAct-Bot), agiert dieser wie eine Person, die durch die Bibliothek geht, ein Buch aufhebt, es liest, es wieder weglegt, das nächste aufhebt und so weiter.
- Die Gehirn-Überlastung: Wenn Sie versuchen, die KI mit allen Büchern auf einmal zu füttern, stößt sie an ein „Kontextlimit“ – ihr Gedächtnis ist zu voll, um alles festzuhalten.
- Der Verlust der Zuordnung: Wenn die KI nach „Geld“ über alle Bücher hinweg sucht, wird sie Ihnen vielleicht sagen: „Ja, Geld wurde erwähnt!“, aber sie kann Ihnen nicht sagen, welches Meeting das gesagt hat. Sie verliert die Verbindung zwischen dem Fakt und der Quelle.
- Der Zeitfresser: Dies nacheinander zu tun, ist quälend langsam. Wenn Sie 3.000 Deals prüfen müssen und jeder einige Sekunden dauert, warten Sie Stunden.
Die Lösung: Der „Meisterplaner“ und das „Fließband“
BatchDAG verändert das Spiel, indem es die Aufgabe in zwei unterschiedliche Rollen aufteilt: den Planer und den Arbeiter.
1. Der Planer (Der KI-Architekt)
Wenn Sie eine Frage stellen wie: „Hat unser Vertriebsteam in jedem Meeting gute Fragen gestellt?“, beginnt die KI noch nicht mit dem Lesen. Stattdessen agiert sie wie ein Architekt, der einen Bauplan zeichnet. Sie erstellt einen Directed Acyclic Graph (DAG).
- Einfache Übersetzung: Stellen Sie sich einen Flowchart vor, der aus Lego-Blöcken besteht. Jeder Block ist eine spezifische Aufgabe: „Datenbank durchsuchen“, „Ergebnisse filtern“, „Nach Meeting gruppieren“ oder „Die KI bitten, zu analysieren“.
- Die KI schreibt diese Karte in einem strengen, strukturierten Format (JSON), nicht in unordentlichen Sätzen. Dies stellt sicher, dass der Computer genau weiß, was er als Nächstes tun muss, ohne verwirrt zu werden.
2. Der Arbeiter (Die deterministische Engine)
Sobald die Karte gezeichnet ist, übernimmt eine superschnelle Computer-Engine. Sie muss nicht „klug“ sein; sie muss nur schnell und gehorsam sein.
- Parallele Wellen: Anstatt Aufgaben nacheinander zu erledigen, sieht die Engine auf der Karte, welche Blöcke gleichzeitig erledigt werden können. Sie führt sie in „Wellen“ aus. Stellen Sie sich eine Stadion-Welle vor: Alle in Sektor A stehen gleichzeitig auf, dann Sektor B, dann Sektor C. Dies macht den Prozess unglaublich schnell.
- Zero-LLM-Schritte: Die meisten Blöcke auf der Karte (wie das Durchsuchen einer Datenbank oder das Sortieren von Zahlen) benötigen die KI überhaupt nicht. Diese werden durch regulären Code erledigt, der kostenlos und instantan ist. Die KI wird nur aufgerufen, wenn die Karte sagt: „Nutze jetzt dein Gehirn, um diese spezifische Gruppe zu analysieren.“
Das Geheimrezept: „Entity-Aware Batching“
Dies ist der größte Trick von Batch-DAG. Stellen Sie sich vor, Sie haben 121 Meetings, und jedes Meeting umfasst 4 8 Seiten Text.
- Der alte Weg (Zeilenbasiert): Wenn Sie die KI mit jeweils 5 Seiten füttern, senden Sie ihr vielleicht die ersten 5 Seiten von Meeting A, dann die nächsten 5 Seiten von Meeting A und so weiter. Sie senden die KI also 10 Mal dasselbe Meeting, aber jedes Mal sieht sie nur ein winziges, verwirrendes Fragment. Das ist verschwenderisch und führt zu schlechten Vermutungen.
- Der BatchDAG-Weg (Entity-Aware): Das System gruppiert die Seiten zuerst nach der Meeting-ID. Es sagt: „Hier sind 5 vollständige Meetings, einschließlich all ihrer Seiten.“ Es sendet der KI 5 ganze Geschichten statt 100 winziger Fragmente.
- Das Ergebnis: Diese einfache Gruppierung reduzierte die Anzahl der Aufrufe der KI um den Faktor 47. Es ist, als würde man einen Detektiv schicken, um 5 ganze Häuser zu untersuchen, anstatt 235 verschiedene Zimmer zu untersuchen, die über die ganze Stadt verstreut sind.
Was sie herausgefunden haben
Die Forscher testeten dieses System mit realen Daten von Brevian.ai, die über 50.000 Meetings und 3.000 Geschäftsdeals umfasst.
- Geschwindigkeit: Sie analysierten 3.000 Deals in unter 60 Sekunden. Ein Standard-KI-Agent hätte für dieselbe Aufgabe etwa 100 Minuten benötigt.
- Kosten: Da das System vermeidet, das teure KI-Gehirn für jeden einzelnen Schritt aufzurufen, sank die Kosten drastisch. Eine einfache Datenbankabfrage kostete nur 0,02 $. Selbst eine komplexe Analyse von tausenden Meetings kostete nur etwa 0,24 $ pro Abfrage.
- Genauigkeit: Das System war genauso gut wie ein menschlicher Experte, der einen maßgeschneiderten Workflow entwirft (Bewertung von 3,74 von 5 gegenüber 3,25 für eine von Menschen entworfene Pipeline) und signifikant besser als ein Standard-KI-Agent.
- Wahrhaftigkeit: Am wichtigsten ist, dass BatchDAG viel besser darin war, seine Antworten zu belegen. Es konnte in 77 % der Fälle auf die exakten Transkript-Belege verweisen, verglichen mit nur 46–60 % bei anderen Methoden. Dies ist entscheidend für Unternehmen, die wissen müssen, warum eine KI eine Behauptung aufgestellt hat.
Warum das wichtig ist
Das Paper legt nahe, dass wir bei Big-Data-Problemen die KI nicht einfach nur „schlauer“ machen sollten. Stattdessen sollten wir aufhören, die KI die schwere Arbeit erledigen zu lassen. Der beste Ansatz ist, die KI den Job planen zu lassen, und dann eine schnelle, langweilige, zuverlässige Maschine zu nutzen, um den Job zu erledigen.
Durch die Verwendung strukturierter Daten (wie ordentliche Zeilen in einer Tabelle) anstelle von unordentlichen Zusammenfassungen zwischen den Schritten reduzierte das System auch „Halluzinationen“ (erfundene Fakten) um 27 %. Die Autoren fanden heraus, dass die KI dazu neigt, Details zu verlieren, wenn sie Zusammenfassungen in natürlicher Sprache zwischen den Schritten erstellt. Aber wenn sie strukturierte Daten weitergibt, bleiben die Fakten fest verankert.
Kurz gesagt: Bei BatchDAG geht es nicht darum, die KI zum Genie zu machen; es geht darum, die KI zu einem großartigen Manager zu machen, der genau weiß, wann er die Experten rufen muss und wann er die Fließbandarbeit erledigen lassen sollte. Es verwandelt einen langsamen, teuren und fehleranfälligen Prozess in einen schnellen, günstigen und zuverlässigen Prozess.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.