← Neueste Arbeiten
🤖 machine learning

A Human-in-the-Loop Autonomous Agent for Industry Time Series Forecasting

Dieses Paper stellt CastClaw vor, einen Human-in-the-Loop-autonomen Agenten, der natürliche Sprachaufgabenspezifikation, spezialisierte Prognosemodelle und iterative evidenzbasierte Verfeinerung integriert, um 16 Baselines bei der Strompreis- und Lastprognose zu übertreffen und gleichzeitig transparente Ausführungsberichte bereitzustellen.

Ursprüngliche Autoren: Xiaoyu Tao, Mingyue Cheng, Ze Guo, Bokai Pan, Qi Liu, Shijin Wang, Enhong Chen

Veröffentlicht 2026-09-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xiaoyu Tao, Mingyue Cheng, Ze Guo, Bokai Pan, Qi Liu, Shijin Wang, Enhong Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Vorhersage der Zukunft von Zahlen, die sich über die Zeit verändern – wie etwa der Strompreis oder die Last auf einem Stromnetz – ist eine Aufgabe, die mit einer einzelnen, isolierten Berechnung selten gelingt. In der realen Welt besteht eine präzise Prognose nicht bloß darin, historische Daten in ein Computerprogramm einzuspeisen und auf eine Antwort zu warten. Es ist ein komplexer, iterativer Prozess, bei dem ein menschlicher Experte das Ziel definieren, die richtigen Datenquellen verknüpfen, spezifisches Wissen darüber anwenden muss, wie die Welt funktioniert, und dann sorgfältig beurteilen muss, ob die Vermutung des Computers sinnvoll ist. Wenn die Vorhersage seltsam aussieht, muss der Experte fehlende Informationen finden, den Ansatz anpassen oder entscheiden, abzubrechen und etwas anderes zu versuchen. Seit Jahren ist das Feld gespalten zwischen spezialisierten Computermodellen, die exzellent darin sind, Zahlen zu verarbeiten, aber starr in ihrem Denken, und allgemeinen KI-Agenten, die zwar schlussfolgern und kommunizieren können, aber oft nicht über die strengen Regeln und Kontrollen verfügen, die für eine zuverlässige numerische Vorhersage erforderlich sind.

Forscher der University of Science and Technology of China haben ein neues System namens CastClaw entwickelt, um diese Lücke zu schließen. Es handelt sich um einen autonomen Agenten, der darauf ausgelegt ist, Hand in Hand mit einem Menschen zu arbeiten, indem er als unermüdlicher Assistent fungiert, der die schwere Arbeit der Datenanalyse übernimmt, während die endgültige Beurteilung und Aufsicht der verantwortlichen Person überlassen wird. Das System ersetzt den Menschen nicht; stattdessen schafft es eine Schleife, in der der Computer eine Prognose vorschlägt, diese gegen bekannte Muster und Benutzerregeln prüft und seine Meinung nur dann ändert, wenn er fundierte Beweise für eine Revision findet. Wenn die Beweise fehlen, weiß das System, dass es den Menschen um Hilfe bitten oder nach mehr Kontext suchen muss, anstatt blind zu raten. Dieser Ansatz verwandelt die Vorhersage von einer einmaligen Berechnung in einen dokumentierten, überprüfbaren Arbeitsablauf, bei dem jeder Schritt, von der ursprünglichen Frage bis zur finalen Zahl, aufgezeichnet und überprüft werden kann.

Der Kern von CastClaw ist ein Framework, das die Forscher als „Harness“ (Geschirr) bezeichnen und das als zentrales Nervensystem fungiert, welches verschiedene Werkzeuge miteinander verbindet. Wenn ein Benutzer eine Frage in natürlicher Sprache stellt, wie etwa die Vorhersage der Strompreise für den nächsten Tag, identifiziert das System zuerst, welche Daten benötigt werden und welche Regeln befolgt werden müssen. Es ruft dann eine Prognose aus einem spezialisierten Modell ab oder nutzt eine vom Benutzer bereitgestellte. Bevor es diese Zahl akzeptiert, führt das System eine Reihe von Prüfungen durch. Es untersucht aktuelle Muster, um zu sehen, ob die Vorhersage passt, vergleicht sie mit Domänenwissen wie Wettereffekten oder Angebots- und Nachfragedynamiken und verifiziert, dass sie alle vom Benutzer festgelegten harten Randbedingungen erfüllt. Wenn die Prognose diese Tests besteht, wird sie beibehalten. Wenn sie scheitert, verwirft das System sie nicht einfach; es untersucht den Grund. Es sucht möglicherweise nach fehlendem Kontext, führt eine andere Art von Analyse durch oder konsultiert ein anderes Modell, um zu sehen, ob ein besserer Kandidat existiert.

Entscheidend ist, dass das System weiß, wann es aufhören muss. Es wird nicht unendlich lange seine Meinung ändern. Es stoppt den Prozess, wenn die Vorhersage durch Beweise gestützt wird, wenn weitere Änderungen unwahrscheinlich hilfreich sind, wenn ein Rechenbudget aufgebraucht ist oder wenn ein menschlicher Experte für eine endgültige Entscheidung benötigt wird. Jede Aktion, die das System unternimmt, jedes Stück Evidenz, das es findet, und jede Version der Prognose, die es in Betracht zieht, wird in einem detaillierten Bericht gespeichert. Dieser Bericht ermöglicht es einem Menschen zu sehen, wie genau die finale Zahl erreicht wurde, einschließlich etwaiger Warnungen oder ungelöster Fragen, die bestehen bleiben. Das System betrachtet den menschlichen Input nicht als einen finalen Befehl, der ignoriert werden muss, sondern als einen wesentlichen Teil der Beweiskette, der die Aufgabe korrigieren, neue Hypothesen hinzufügen oder den Durchlauf jederzeit stoppen kann.

Um zu testen, ob dieser Ansatz tatsächlich funktioniert, wandten die Forscher CastClaw auf fünf verschiedene öffentliche Datensätze von Strompreisen aus Belgien, Deutschland, Frankreich, dem Nordic Pool und PJM in den USA an. Sie verglichen die Leistung des Systems mit sechzehn anderen Methoden, die von traditionellen statistischen Werkzeugen bis hin zu fortgeschrittenen KI-Modellen reichen. In jedem einzelnen Fall lieferte CastClaw die genauesten Vorhersagen, gemessen daran, wie nah die Zahlen an den tatsächlichen zukünftigen Werten lagen. Es übertraf die besten bestehenden Methoden um deutliche Margen und reduzierte die Fehler in einigen Regionen um bis zu dreißig Prozent. Die Forscher demonstrierten das System auch in einem Live-Szenario unter Verwendung von Daten aus dem nordischen Strommarkt. In dieser Demonstration lieferte ein Benutzer eine initiale Prognose, und das System prüfte diese gegen die Marktbedingungen. Als das System feststellte, dass eine vorgeschlagene Anpassung die Vorhersage tatsächlich verschlechtern würde, lehnte es die Änderung ab und behielt die ursprüngliche Prognose bei, wobei es den gesamten Entscheidungsprozess dokumentierte. Dies zeigte, dass das System zu kritischem Denken fähig ist und weiß, wann es zu einer guten Idee „Ja“ sagen muss und wann es zu einer schlechten Idee „Nein“ sagen muss, und dass der Arbeitsablauf selbst vollständig überprüfbar ist.

Die Forscher ließen das System zudem auf Offline-Daten laufen, die die Stromlasten in Nordchina für die erste Hälfte des Jahres 2026 darstellten. Diese Übung diente dazu, die Offline-Workflow-Ausführung unter Verwendung derselben Aufgabenbeschreibungen, Modelle und Werkzeuge zu validieren, war jedoch nicht dazu gedacht, eine Online-Bereitstellung, den produktiven Einsatz oder die Vergleichsgenauigkeit gegenüber anderen Modellen zu demonstrieren. Die Ergebnisse bestätigten, dass das System den vollständigen Workflow in einer Offline-Umgebung von Anfang bis Ende ausführen kann, wobei es Daten, Werkzeuge und Entscheidungen gemäß seinen Regeln verwaltet und detaillierte Berichte erstellt. Die Studie macht deutlich, dass das System zwar hochfähig ist, aber keine Wunderbox ist, die jedes Problem sofort löst. Es ist ein Werkzeug, das einen Menschen erfordert, um die Ziele zu definieren und die endgültige Aufsicht zu führen, um sicherzustellen, dass die Vorhersagen in der Realität verwurzelt und für die Entscheidungsfindung nützlich bleiben. Durch die Kombination der Geschwindigkeit von Maschinen mit dem Urteilsvermögen von Menschen bietet CastClaw einen neuen Weg, um das schwierige Problem der Vorhersage der Zukunft anzugehen, indem es einen chaotischen Prozess in eine klare, zuverlässige und transparente Reise verwandelt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →