← Neueste Arbeiten
💬 NLP

ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups

Das Papier stellt ConsistencyAI vor, einen unabhängigen Benchmark, der 19 große Sprachmodelle auf faktische Konsistenz über diverse demografische Personas hinweg evaluiert und aufzeigt, dass die Konsistenzwerte je nach Modellanbieter und Thema signifikant variieren, mit einem mittleren Benchmark-Schwellenwert von 0,8656.

Ursprüngliche Autoren: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

Veröffentlicht 2026-09-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Im modernen Informationszeitalter wenden wir uns immer häufiger an künstliche Intelligenz, um unsere Fragen zu beantworten, vom Preis der Milch bis hin zu den Details komplexer Geschichte. Diese Systeme, bekannt als große Sprachmodelle, sind darauf ausgelegt, die menschliche Sprache zu verstehen und Texte zu generieren, die sich wie ein Gespräch anfühlen. Sie sind zu einem primären Weg geworden, über den Menschen auf Fakten zugreifen, und ersetzen oft traditionelle Suchmaschinen für schnelle Antworten. Es bleibt jedoch eine grundlegende Frage darüber bestehen, wie diese Maschinen funktionieren: Erzählen sie jedem dieselbe Geschichte, oder verändern sie die Fakten je nach Fragesteller? Wenn ein Computerprogramm weiß, dass Sie ein junger Student sind, präsentiert es dann eine andere Menge an Wahrheiten, als es dies einem älteren Manager tun würde? Diese Möglichkeit wirft Fragen hinsichtlich Fairness und der Integrität von Informationen auf. Wenn sich die Fakten selbst basierend auf dem Hintergrund einer Person, wie etwa Alter, Geschlecht oder Beruf, verschieben, deutet dies darauf hin, dass das System nicht nur eine Frage beantwortet, sondern die Realität an ein bestimmtes Publikum anpasst. Dieses Phänomen, falls es real ist, könnte die Art und Weise, wie verschiedene Gruppen der Menschen die Welt verstehen, subtil beeinflussen und potenzielle Gräben vertiefen, anstatt sie zu überbrücken.

Um dies zu untersuchen, entwickelten Forscher der Duke University und der University of North Carolina einen neuen Test namens ConsistencyAI. Ihr Ziel war es zu sehen, ob große Sprachmodelle verschiedenen Menschen unterschiedliche Fakten erzählen. Sie baten die Modelle nicht darum, zu prüfen, ob die Informationen wahr sind; stattdessen fragten sie, ob die Modelle demselben 25-jährigen Lehrer dieselben Fakten lieferten wie einem 60-jährigen Bauarbeiter. Das Team baute ein System, das eine diverse Gruppe von Menschen aus den Vereinigten Staaten simulierte, die ein breites Spektrum an Alter, Berufen und Hintergründen repräsentierten. Sie baten dann fünfundzwanzig verschiedene Modelle der künstlichen Intelligenz, fünf Fakten zu fünfzehn verschiedenen Themen bereitzustellen, wie etwa Wohnkosten, Handelsdefizite und politische Konflikte. Jede Frage wurde jedem Modell einhundert Mal gestellt, wobei der Kontext der fragenden Person bei jedem Mal mithilfe eines Datensatzes von 100 Personas, die aus einem repräsentativen Datensatz entnommen wurden, variiert wurde. Durch den Vergleich der Antworten konnten die Forscher messen, wie stark sich der Inhalt änderte, wenn sich die Persona änderte.

Die Ergebnisse zeigten, dass viele Modelle zwar im Allgemeinen konsistent sind, aber nicht perfekt. Die Forscher fanden heraus, dass die Modelle die Fakten, die sie präsentieren, tatsächlich basierend darauf änderten, wem sie glaubten zu entsprechen. In einem groß angelegten Test mit 100 Personas lagen die Konsistenzwerte der Modelle zwischen einem Hoch von 0,9137 und einem Tief von 0,6719, mit einem Durchschnittswert von 0,8555. Dieser Durchschnitt wurde zum Referenzwert der Studie. Das konsistenteste Modell war xAIs Grok-4, das unabhängig vom Nutzer bemerkenswert stabil in seinen Fakten blieb. Am anderen Ende des Spektrums zeigten mehrere leichtere und mittelmäßige Modelle die größte Variation. Die Studie zeigte, dass das behandelte Thema ebenso wichtig war wie das Modell selbst. Wenn beispielsweise nach dem US-Handelsdefizit gefragt wurde, einem Thema mit klaren, standardisierten Regierungsdaten, waren die Modelle sehr konsistent. Wenn jedoch nach Wohnkosten gefragt wurde, einem Thema mit komplexen und vielfältigen Datenquellen, lieferten die Modelle viel unterschiedlichere Antworten an verschiedene Menschen.

Die Forscher entdeckten auch, dass die Modelle nicht nur ihren Tonfall oder Stil änderten, sondern tatsächlich unterschiedliche Fakten auswählten. Wenn sich die Persona änderte, verschoben sich oft die spezifischen Details, Organisationen und Zahlen in der Antwort. Beispielsweise neigte ein Modell bei dem Thema Grenzsicherheit dazu, älteren Nutzern Antworten mit dem Fokus auf Strafverfolgung zu geben, während jüngere Nutzer Antworten erhielten, die sich auf Geografie konzentrierten. Ein anderes Modell lieferte vereinfachte, analogiebasierte Antworten an Minderjährige, aber direkte, faktische Antworten an Erwachsene. Dies deutet darauf hin, dass die Modelle sensibel auf demografische Hinweise reagieren und ihre Informationen entsprechend anpassen. Die Studie stellte auch fest, dass die Tatsache, ein fortgeschritteneres oder „reasoning“-Modell (ein Modell mit Denkvermögen) zu sein, keine bessere Konsistenz garantierte. Einige kleinere, ältere Modelle schnitten besser ab als die neuesten, komplexesten Systeme, was darauf hindeutet, dass Konsistenz nicht einfach ein Nebenprodukt der Größe oder Intelligenz eines Modells ist.

Ein bedeutender Teil der Forschung konzentrierte sich auf kontroverse Themen. Der israelisch-palästinensische Konflikt zeigte die größte Variation in den Antworten, wobei einige Modelle sehr konsistente Fakten lieferten und andere völlig unterschiedliche. Bei diesem Thema verweigerten einige Modelle sogar die Antwort oder gaben Fehler zurück, insbesondere wenn der Nutzer als Kind identifiziert wurde. Dies deutet darauf hin, dass Modelle über eingebaute Filter verfügen könnten, die sie dazu bringen, sich bei sensiblen Themen je nach wahrgenommenerem Nutzer zurückzuziehen. Die Studie fand auch heraus, dass politische Sensibilität allein die Inkonsistenz nicht vorhersagte. Während einige politischen Themen hochgradig inkonsistent waren, waren andere dies nicht, und selbst nicht-politische Themen wie Wohnkosten zeigten eine geringe Konsistenz. Dies deutet darauf hin, dass die Schwierigkeit, ein einzelnes, stabiles Narrativ in den Daten zu finden, ein wesentlicher Faktor ist. Wenn die verfügbaren Informationen zu einem Thema ungeordnet oder umstritten sind, ist das Modell wahrscheinlicher dazu geneigt, verschiedenen Menschen unterschiedliche Fakten zu präsentieren.

Die Autoren betonen, dass ihre Arbeit nicht bestimmt, ob die Fakten wahr sind, sondern ob die Fakten stabil sind. Sie argumentieren, dass es schädlich sein kann, selbst wenn die Informationen korrekt sind, unterschiedliche Sätze von Fakten an verschiedene Menschen zu präsentieren. Es kann zu Bestätigungsfehlern führen, bei denen Menschen nur die Version der Realität hören, die zu ihren bestehenden Überzeugungen passt, oder es kann Stereotypen verstärken. Die Studie legt nahe, dass künstliche Intelligenz wirklich zuverlässig sein muss, indem sie einen stabilen Satz von Fakten bereitstellt, unabhängig davon, wer fragt. Die Forscher haben ihre Testwerkzeuge und eine interaktive Website veröffentlicht, damit Journalisten, Entwickler und die Öffentlichkeit selbst sehen können, wie sich verschiedene Modelle verhalten. Sie hoffen, dass diese Transparenz Unternehmen dazu ermutigt, Systeme zu bauen, die weniger wahrscheinlich dazu neigen, die Wahrheit an den Nutzer anzupassen, um sicherzustellen, dass die Informationen, auf die wir uns alle verlassen, konsistent und vertrauenswürdig bleiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →