← Neueste Arbeiten
🤖 machine learning

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

Dieses Paper schlägt TiMi vor, ein neuartiges Framework, das Large Language Models für kausales Schließen und ein leichtgewichtiges multimodales Mixture-of-Experts-Modul nutzt, um textuelle Informationen ohne explizite Ausrichtung effektiv in die Zeitreihenprognose zu integrieren und so eine State-of-the-Art-Leistung über sechzehn realen Benchmarks hinweg zu erzielen.

Ursprüngliche Autoren: Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

Veröffentlicht 2026-08-19
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Zeitreihenprognose ist die Wissenschaft, eine Sequenz von Zahlen, die über einen Zeitraum aufgezeichnet wurden, zu analysieren, um vorherzusagen, was als Nächstes passieren wird. Sie ist der Motor hinter der Vorhersage von allem, von den Benzinpreisen bis hin zur Ausbreitung eines Grippeausbruchs. Jahrzehntelang stützten sich die erfolgreichsten Methoden fast ausschließlich auf die Zahlen selbst und suchten nach Mustern in der Vergangenheit, um diese in die Zukunft zu projizieren. Die reale Welt besteht jedoch selten nur aus einem Strom von Zahlen. Sie ist ein komplexes System, das von Schlagzeilen, Regierungsentscheidungen und unerwarteten Ereignissen beeinflusst wird, die oft eher als Text denn als Datenpunkte erscheinen. Während Menschen natürlich einen Nachrichtenbericht über eine Unterbrechung der Lieferkette lesen und ihre Erwartungen für zukünftige Preise anpassen, hatten traditionelle Computermodelle Schwierigkeiten, dasselbe zu tun. Sie behandeln Text oft als eine separate, verwirrende Ebene, die schwer mit dem glatten Fluss numerischer Daten in Einklang zu bringen ist, was zu Vorhersagen führt, die danebenliegen, wenn sich die Welt verändert.

Ein Team von Forschern der Tsinghua-Universität hat einen neuen Weg vorgeschlagen, um diese Lücke zu schließen, und ein System namens TiMi eingeführt. Anstatt zu versuchen, Text und Zahlen in dasselbe starre Format zu zwingen, betrachtet ihr Ansatz die beiden als unterschiedliche, aber kooperative Wegweiser. Der Kern der Idee besteht darin, ein großes Sprachmodell – eine Art künstliche Intelligenz, die auf riesigen Mengen menschlicher Texte trainiert wurde – dazu zu nutzen, den Text zu lesen und darüber zu urteilen, was er für die Zukunft bedeutet. Das Modell memoriert nicht nur die Wörter; es analysiert sie, um kausale Faktoren abzuleiten, wie etwa, ob eine neue politische Maßnahme den Umsatz steigen oder sinken lässt. Dieses Schlussfolgern wird dann an eine spezialisierte Prognose-Engine übergeben, die diesen Einblick nutzt, um ihre numerischen Vorhersagen zu verfeinern. Die Forscher fanden heraus, dass das System deutlich genauere Prognosen erstellen konnte, indem sie das Sprachmodell als Wegweiser für die Zahlen einsetzten, anstatt zu versuchen, sie zu einem einzigen, unübersichtlichen Gemisch zu verschmelzen.

Die Forscher testeten diese Methode an sechzehn verschiedenen realen Datensätzen, die vielfältige Bereiche wie Landwirtschaft, Klima, Energie und öffentliche Gesundheit abdeckten. In diesen Tests übertraf das neue System konsequent bestehende fortschrittliche Modelle, einschließlich jener, die zuvor versucht hatten, Text und Zahlen zu kombinieren. Die Ergebnisse waren besonders beeindruckend in Szenarien, in denen der Text einen klaren Grund für eine Veränderung der Zahlen lieferte, wie etwa ein Bericht über einen Smartphone-Rückruf, der zu einem starken Einbruch der Verkaufszahlen führte. In diesen Fällen nutzte das neue System den Text erfolgreich, um den Rückgang vorauszusehen, während andere Modelle den plötzlichen Wandel oft nicht erfassen konnten. Die Studie legt nahe, dass der Schlüssel zu besseren Prognosen nicht darin liegt, verschiedene Arten von Daten gleich aussehen zu lassen, sondern darin, jeder Art zuzulassen, was sie am besten kann: Text liefert die Geschichte und die Ursache, während Zahlen die Aufzeichnung und den Trend liefern.

Um dies umzusetzen, entwarf das Team ein modulares System, das wie eine Gruppe spezialisierter Berater fungiert. Ein Teil des Systems konzentriert sich ausschließlich auf die historischen Zahlen und lernt die langfristigen Rhythmen und Muster der Daten. Ein anderer Teil konzentriert sich auf den Text und nutzt das Sprachmodell, um strukturierte Erkenntnisse über zukünftige Trends zu gewinnen, wie etwa, ob die Aussichten steigend, fallend oder stabil sind. Diese beiden Informationsströme werden dann auf eine Weise zusammengeführt, die es dem System ermöglicht, den relevantesten Rat für den spezifischen Moment zu wählen. Wenn der Text darauf hindeutet, dass ein bedeutendes Ereignis bevorsteht, stützt sich das System stark auf diesen Einblick. Wenn der Text vage oder irrelevant ist, verlässt sich das System eher auf die historischen Muster. Diese Flexibilität ermöglicht es dem Modell, mit unordentlichen, realen Daten umzugehen, bei denen Text und Zahlen möglicherweise nicht gleichzeitig oder im gleichen Format eintreffen.

Die Forscher untersuchten auch, wie gut dieses System funktioniert, wenn die Daten unregelmäßig sind, was in der realen Welt häufig vorkommt. In vielen Situationen erscheinen Nachrichtenberichte zu unvorhersehbaren Zeiten oder es fehlen Daten für bestimmte Tage. Traditionelle Modelle haben mit diesen Lücken oft zu kämpfen, aber das neue System bewältigte sie mit Leichtigkeit. Da es den Text und die Zahlen separat verarbeitet, bevor es deren Erkenntnisse kombiniert, erfordert es kein perfektes Timing zwischen den beiden. In Tests mit unregelmäßigen Datensätzen reduzierte das System die Vorhersagefehler im Vergleich zu Standardmethoden um fast dreißig Prozent. Diese Robustheit deutet darauf hin, dass der Ansatz nicht nur eine theoretische Verbesserung ist, sondern ein praktisches Werkzeug, das mit den unvollkommenen, asynchronen Daten arbeiten kann, die in tatsächlichen Anwendungen vorkommen.

Ein entscheidender Teil der Studie bestand darin, zu verstehen, wie das System seine Entscheidungen trifft. Die Forscher fanden heraus, dass das System ähnliche Arten von Datentrends natürlich gruppierte. Wenn das System beispielsweise gebeten wurde, die Zukunft eines Datensatzes mit einem starken Aufwärtstrend vorherzusagen, verließ es sich konsequent auf einen spezifischen Teil seiner internen Logik. Wenn der Trend abwärts gerichtet war, wechselte es zu einem anderen Teil. Dieses Verhalten zeigt, dass das System nicht nur rät; es lernt zu spezialisieren, indem es verschiedene „Experten“ innerhalb seines Gehirns zuweist, um unterschiedliche Zukftsszenarien zu bewältigen. Darüber hinaus zeigte die Studie, dass die Qualität des Textes entscheidend ist. Wenn die Forscher dem System verrauschte oder irrelevante Texte einspeisten, sank die Leistung des Systems nur geringfügig, was beweist, dass es in der Lage ist, das Rauschen zu filtern und sich auf das Signal zu konzentrieren.

Die Ergebnisse stellen die gängige Vorstellung in Frage, dass der beste Weg, Text und Zahlen zu kombinieren, darin besteht, sie zu einer einzigen, einheitlichen Repräsentation zu verschmelzen. Frühere Versuche versuchten oft, Text in einen numerischen Code zu übersetzen, der direkt mit den Zeitreihendaten gemischt werden konnte – ein Prozess, der die Bedeutung des Textes oft verwässerte. Der neue Ansatz lehnt diese Verschmelzung zugunsten einer geführten Interaktion ab. Indem er den Text als Quelle der kausalen Argumentation und die Zahlen als Gegenstand der Vorhersage beibehält, bewahrt das System die einzigartigen Stärken beider Seiten. Die Forscher demonstrierten, dass diese Methode in einer Vielzahl von Domänen funktioniert, von der Verfolgung von Influenza-Fällen bis hin zur Vorhersage des Verkehrsaufkommens, was darauf hindeutet, dass die Fähigkeit, Texte zu lesen und über sie zu urteilen, ein universeller Gewinn für die Prognose ist.

Letztendlich bietet die Arbeit einen klareren Weg für die Zukunft der künstlichen Intelligenz in der Zeitreihenanalyse. Sie zeigt, dass die Zukunft der Prognose nicht darin liegen könnte, größere, komplexere Modelle zu bauen, die versuchen, alles gleichzeitig zu erledigen, sondern Systeme zu entwerfen, die wissen, wie man auf verschiedene Arten von Informationen hört. Indem man ein Sprachmodell die Nachrichten lesen und ein Prognosemodell die Zahlen beobachten lässt und sie dann zusammenarbeiten lässt, erreicht das System ein Maß an Genauigkeit und Anpassungsfähigkeit, das keines der beiden allein erreichen könnte. Die Ergebnisse legen nahe, dass für jeden, der die Zukunft komplexer Systeme vorhersagen möchte, die Geschichte hinter den Zahlen genauso wichtig ist wie die Zahlen selbst.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →