← Neueste Arbeiten
💬 NLP

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

Das Paper stellt HORIZON vor, ein umfassendes Benchmark für die Modellierung von Nutzerverhalten in der realen Welt, das durch seine große, domänenübergreifende Datenbasis und neue Evaluierungsaufgaben die Grenzen bestehender, oft zu eingeschränkter Benchmarks überwindet und die Entwicklung robusterer, generalisierbarer Benutzermodelle fördert.

Ursprüngliche Autoren: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

Veröffentlicht 2026-04-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, du hast einen sehr guten Freund, der dich schon seit Jahren kennt. Er weiß, dass du gerne Kaffee trinkst, Filme schaust und hin und wieder neue Schuhe kaufst. Wenn du ihn fragst: „Was soll ich heute Abend essen?", gibt er dir einen perfekten Vorschlag, basierend auf dem, was du gestern gegessen hast.

Das ist im Grunde das, was Empfehlungssysteme heute tun. Sie sind wie dieser Freund, aber sie haben ein großes Problem: Sie sind oft nur sehr kurzlebig und sehen die Welt in kleinen, getrennten Schubladen.

Hier ist die Geschichte des neuen Forschungsprojekts HORIZON, das genau dieses Problem lösen will – erklärt ganz einfach:

Das Problem: Der Freund mit dem Tunnelblick

Bisher waren die „Freunde" (die KI-Modelle) sehr spezialisiert.

  • Ein Freund kannte sich nur mit Filmen aus. Wenn du ihn nach einem Buch fragst, war er ratlos.
  • Ein anderer kannte sich nur mit Schuhen aus.
  • Und alle dachten nur an das nächste Ding. „Was willst du jetzt kaufen?", fragten sie. Aber sie vergaßen, dass du vielleicht in sechs Monaten ein neues Hobby beginnst oder dass deine Vorlieben sich langsam ändern.

Die alten Tests, mit denen man diese Freunde prüfte, waren wie ein Quiz, bei dem man nur Fragen aus dem gleichen Buch stellt, das man gerade gelesen hat. Das Ergebnis war immer gut, aber es sagte nichts darüber aus, wie der Freund sich verhält, wenn er plötzlich in eine völlig neue Stadt zieht oder wenn du dich über Jahre hinweg verändert hast.

Die Lösung: HORIZON – Der große, echte Test

Die Forscher haben HORIZON geschaffen. Stell dir das wie einen riesigen, realistischen Lebenslauf vor, der aus 54 Millionen echten Menschen und 35 Millionen verschiedenen Produkten besteht (von Büchern über Elektronik bis hin zu Gartenwerkzeug).

Das Besondere an HORIZON ist, dass es keine Schubladen mehr gibt. Es schaut auf das ganze Leben eines Nutzers.

Die drei neuen Herausforderungen (Die „Drei Achsen")

HORIZON prüft die Freunde an drei neuen, schwierigen Kriterien:

  1. Der Zeit-Test (Langzeitgedächtnis):

    • Alte Methode: „Was hast du vor 5 Minuten gekauft?"
    • HORIZON: „Wir schauen uns deine Aktivitäten von vor 5 Jahren an. Was wirst du in 5 Jahren kaufen?"
    • Die Metapher: Es ist wie ein Zeitreise-Test. Der Freund muss nicht nur das Heute verstehen, sondern auch, wie sich deine Vorlieben über Jahre hinweg entwickeln.
  2. Der Fremden-Test (Unbekannte Gesichter):

    • Alte Methode: Der Freund wird nur mit Leuten getestet, die er schon kennt.
    • HORIZON: Der Freund muss sich plötzlich um völlig fremde Menschen kümmern, die er noch nie gesehen hat.
    • Die Metapher: Ein Lehrer, der nur seine eigenen Schüler kennt, ist gut. Aber ein guter Lehrer muss auch verstehen können, wie ein völlig neuer Schüler lernt, ohne ihn vorher je gesehen zu haben.
  3. Der Mix-Test (Die Welt verbinden):

    • Alte Methode: Wenn du Bücher kaufst, denkt das System nur an Bücher.
    • HORIZON: Es erkennt, dass jemand, der ein Kochbuch kauft, vielleicht auch ein neues Messer braucht, und dass jemand, der ein Buch über Astronomie liest, vielleicht später ein Teleskop kaufen wird.
    • Die Metapher: Statt in getrennten Räumen zu wohnen, zieht der Freund in ein großes Haus, in dem alle Themen miteinander verbunden sind.

Was haben sie herausgefunden? (Die Ergebnisse)

Die Forscher haben verschiedene „Freunde" (KI-Modelle) getestet, darunter auch die neuesten, sehr großen Sprachmodelle (LLMs), die wie Super-Intelligenzen wirken.

  • Die Überraschung: Die alten, spezialisierten Modelle waren in den neuen Tests oft besser als die riesigen Sprachmodelle.
  • Das Problem: Die großen Sprachmodelle (wie ChatGPT) waren zwar gut darin, Texte zu verstehen, aber sie scheiterten oft daran, konkrete Produkte vorherzusagen, wenn sie auf völlig neue Nutzer oder ferne Zukunftsszenarien getroffen wurden. Sie waren wie ein sehr gebildeter Professor, der aber im echten Supermarkt den Überblick verliert.
  • Die Erkenntnis: Unsere aktuellen Modelle sind zu sehr darauf trainiert, das „Offensichtliche" zu erraten. Wenn sich die Welt ändert (neue Produkte, neue Nutzer), verlieren sie den Anschluss.

Warum ist das wichtig?

Stell dir vor, du planst eine Reise.

  • Ein schlechtes System sagt dir: „Du hast gestern Pizza gegessen, also iss heute wieder Pizza."
  • Ein gutes System (wie HORIZON es anstrebt) sagt: „Du hast in den letzten Jahren immer mehr Outdoor-Ausrüstung gekauft, und im Winter hast du oft über Wandern gelesen. Vielleicht solltest du dir jetzt eine neue Jacke ansehen, auch wenn du gestern Pizza gegessen hast."

HORIZON ist also kein neues Produkt, das man kaufen kann. Es ist ein neuer Maßstab (ein Benchmark). Es ist wie ein strenger Prüfer, der sagt: „Hört auf, nur kleine Quizfragen zu stellen. Zeigt mir, dass ihr wirklich versteht, wie Menschen sich über Jahre hinweg und über verschiedene Themen hinweg verhalten."

Damit wollen die Forscher sicherstellen, dass die KI der Zukunft nicht nur ein kurzfristiger Ratgeber ist, sondern ein echter, langfristiger Begleiter, der uns wirklich versteht – egal, wie sich unser Leben verändert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →