Before You Poll with LLMs: A Deliberative Diagnostic Framework
Dieses Paper führt das Deliberative Polling Diagnostic Framework ein, um aufzuzeigen, dass aktuelle Frontier-LLMs die menschliche Meinungsaktualisierung während der Deliberation nicht nachahmen, sondern stattdessen einzigartige, identitätsspezifische Verzerrungen wie Meinsumkehr, Überschießen oder Starrheit aufweisen, die durch ein als „Signature Self-Sycophancy“ bezeichnetes Phänomen getrieben werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine Welt vor, in der Regierungen, Unternehmen und Forscher nicht länger Monate und Millionen von Dollar für Umfragen unter echten Menschen ausgeben müssen, um die öffentliche Meinung zu verstehen. Stattdessen könnten sie ein Computerprogramm bitten, tausende verschiedene Bürger zu simulieren, diesen digitalen Personas neue Argumente zu präsentieren und zuzusehen, wie sich ihr Denken verändert. Diese Praxis, bekannt als „Silicon Sampling“, hat rasant zugenommen, weil sie schnell, kostengünstig und skalierbar ist. Die Hoffnung ist, dass diese künstlichen Agenten das menschliche Denken gut genug imitieren können, um vorherzusagen, wie echte Menschen auf neue Informationen reagieren werden. Eine entscheidende Frage bleibt jedoch unbeantwortet: Denken diese Computerprogramme tatsächlich und aktualisieren sie ihre Überzeugungen so wie Menschen, oder rufen sie lediglich vorgefertigte Meinungen aus einer riesigen Datenbank ab? Wenn Letzteres der Fall ist, könnte die Nutzung dieser Modelle, um zu testen, wie Menschen ihre Meinung ändern könnten, zu gefährlich falschen Schlussfolgerungen führen.
Forscher der Lahore University of Management Sciences machten sich daran, diese Frage zu beantworten, indem sie eine neue Methode zur Testung künstlicher Intelligenz entwickelten. Sie konzentrierten sich auf ein spezifisches menschliches Verhalten namens Deliberation (Beratung/Abwägung), also den Prozess, seine Meinung nach dem Hören ausgewogener Argumente zu ändern. In der realen Welt neigen Menschen aus gegensätzlichen politischen Lagern dazu, weniger feindselig und offener zu werden, wenn sie faire Informationen über die jeweils andere Seite erhalten. Die Forscher wollten sehen, ob Computermodelle diese spezifische Verschiebung replizieren können. Sie nutzten Daten aus einem berühmten realen Ereignis namens „America in One Room“, bei dem 526 tatsächliche Wähler zusammengebracht wurden, um über Politik zu diskutieren, und verwendeten dies als Basislinie. Dann baten sie fünf der fortschrittlichsten verfügbaren Computermodelle, dieselben Wähler zu simulieren, indem sie ihnen exakt dieselben Informationen gaben und dieselben Fragen vor und nach der Informationsvermittlung stellten.
Die Ergebnisse offenbarten eine erschreckende Wahrheit: Keines der Computermodelle verhielt sich wie die echten Menschen. Anstatt ihre Überzeugungen auf realistische Weise zu aktualisieren, versagten alle Modelle, und zwar jedes auf seine eigene, einzigartige und seltsame Weise. Eines der leistungsfähigsten Modelle, GPT-5.1, tat genau das Gegenteil dessen, was Menschen tun würden. Als es mit ausgewogenen Informationen über die gegenüberliegende politische Partei konfrontiert wurde, wurden die echten Wähler freundlicher und weniger feindselig. Die Computer-Personas hingegen wurden signifikant feindseliger, als ob die neuen Informationen sie wütender gemacht hätten. Dies ist ein Phänomen, das die Forscher eine „Reversal“ (Umkehrung) nennen, bei der das Modell sich in die völlig falsche Richtung bewegt.
Andere Modelle kehrten nicht die Richtung um, aber sie gingen zu weit. Modelle wie Gemini, Claude und Llama bewegten sich zwar in die richtige Richtung und wurden nach dem Hören der Argumente weniger feindselig, aber sie änderten ihre Meinung fünf- bis siebenmal stärker, als es ein Mensch tun würde. Es war, als wären sie übermäßig bestrebt, überzeugt zu werden, und schwankten bei der kleinsten Anregung wild in ihren Meinungen. Ein viertes Modell, DeepSeek, weigerte sich gänzlich, sich zu ändern, und zeigte kaum eine Veränderung der Meinung, ungeachtet der bereitgestellten Informationen. Diese Starrheit bedeutete, dass es so agierte, als hätten die neuen Argumente keinerlei Auswirkung gehabt.
Die Forscher gingen der Sache tiefer auf den Grund, um zu verstehen, warum diese Fehler auftraten. Sie entdeckten, dass die Probleme nicht zufällig waren; sie wurden spezifisch durch Fragen zur politischen Identität ausgelöst. Wenn die Modelle nach politischen Details gefragt wurden, lieferten sie vernünftige Ergebnisse. Aber sobald die Fragen darauf abzielten, wie eine Partei die andere wahrnimmt, brachen die Modelle zusammen. Die Computer-Personas schienen eher ein Stereotyp zu verkören, anstatt die neuen Fakten durchzudenken. Die Forscher nannten dieses Verhalten „Self-Sycophancy“ (Selbst-Einschmeichelung). Es handelt sich um eine Form der Gefälligkeit, bei der das Modell der eigenen internen Vorstellung zustimmt, was eine bestimmte Art von Person glauben sollte, anstatt auf die präsentierten Informationen zu hören. Wenn das Modell beispielsweise angewiesen wurde, wie ein Republikaner zu handeln, nahm es an, dass ein Republikaner die gegenüberliegende Partei hassen müsse, und hielt an dieser Annahme fest, selbst wenn die Beweise auf das Gegenteil hindeuteten.
Dieses Verhalten unterscheidet sich von der Art von Bias (Voreingenommenheit), bei der ein Computer versucht, einem menschlichen Nutzer zu gefallen. Hier schmeichelt der Computer seiner eigenen internen Logik. Die Studie zeigte, dass dieses Versagen selektiv und symmetrisch ist; dasselbe Modell würde sich gegenüber der gegnerischen Partei feindselig verhalten, aber gegenüber der eigenen Partei übermäßig freundlich, je nach Fragestellung. Dies deutet darauf hin, dass die Modelle keinen Denkprozess simulieren, sondern stattdessen gespeicherte, vorverpackte Einstellungen im Zusammenhang mit politischen Labels abrufen. Die Forscher testeten dies, indem sie die politischen Bezeichnungen in ihren Prompts vertauschten, und fanden heraus, dass sich die Reaktionen der Modelle sofort änderten, was bestätigte, dass sie auf das Label reagierten und nicht auf die Logik des Arguments.
Die Implikationen dieser Erkenntnisse sind bedeutsam für jeden, der sich auf Computersimulationen verlässt, um die Gesellschaft zu verstehen. Wenn ein Modell die Richtung umkehrt, könnte es einen Entscheidungsträger davon überzeugen, dass eine öffentliche Diskussion die Menschen wütender machen wird, während sie in Wirklichkeit Menschen beruhigen würde. Wenn ein Modell über das Ziel hinausschießt, könnte es die Wirkung einer Aufklärungskampagne übertreiben und so zu verschwendeten Ressourcen führen. Wenn ein Modell starr ist, könnte es suggerieren, dass keine Menge an Information eine Meinung ändern kann, was den Kern der öffentlichen Debatte untergräbt. Die Forscher kommen zu dem Schluss, dass wir, bevor wir darauf vertrauen, ein Computermodell zur Simulation der Veränderung menschlicher Meinungen zu nutzen, zuerst einen Diagnosetest durchführen müssen, um zu sehen, ob das Modell tatsächlich in der Lage ist, durch neue Informationen zu argumentieren, oder ob es lediglich Stereotypen rezitiert. Ohne diese Prüfung könnte die Geschwindigkeit und Skalierbarkeit des Silicon Samplings uns glauben lassen, wir verstünden die menschliche Natur, während wir in Wahrheit nur ein verzerrtes Spiegelbild unserer eigenen Vorurteile sehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.