Structured Output Collapses Answer Diversity Across 44 Language Models
Diese Studie zeigt, dass das Anfordern strukturierter Ausgabeformate wie JSON, selbst ohne Schema-Erzwingung, die Antwortdiversität signifikant reduziert und die Konvergenz der Modelle hin zu dominanten Antworten über 44 Sprachmodelle hinweg erhöht, was offenbart, dass allein der Register des Prompts – und nicht die Dekodierungsbeschränkungen – eine messbare Homogenisierung des Modellverhaltens vorantreibt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das geheime Leben der KI: Wenn Höflichkeit auf Code trifft
Stellen Sie sich vor, Sie unterhalten sich mit einer riesigen, superintelligenten Bibliothek, die fast alles gelesen hat, was jemals geschrieben wurde. Diese Bibliothek ist eine Künstliche Intelligenz, oder „KI“, und sie ist berühmt für ihre Fähigkeit zu chatten, Witze zu erzählen und Geschichten zu schreiben. Aber hier ist der Haken: Während Menschen es lieben, in unordentlichen, fließenden Sätzen zu chatten, sprechen Computer nicht so. Computer sprechen in strengen, organisierten Boxen namens „strukturierten Daten“, wie JSON oder XML. Denken Sie an den Unterschied zwischen einem Poeten, der ein freier Sonett schreibt, und einem Kassierer, der Artikel in eine Kasse scannt, bei der jeder Artikel in eine bestimmte Schublade passen muss.
Lange Zeit haben Wissenschaftler untersucht, wie sich diese KIs verhalten, wenn sie wie Poeten chatten. Sie stellen Fragen wie: „Nenne einen Baum“, und sehen nach, was die KI sagt. Normalerweise, wenn man 44 verschiedene KIs diese Frage stellt, wählen sie vielleicht alle unterschiedliche Bäume, oder sie wählen zufällig alle denselben. Diese Arbeit stellt eine einfache, aber knifflige Frage: Was passiert, wenn wir aufhören, die KI wie einen Poeten chatten zu lassen, und sie zwingen, wie ein Kassierer zu antworten? Ändert die KI ihre Meinung? Wird sie langweiliger? Oder bleibt sie gleich? Das ist wichtig, weil die KI, mit der Sie auf Ihrem Telefon chatten, sehr unterschiedlich von der KI sein könnte, die tatsächlich die Software im Hintergrund steuert, und wir müssen wissen, ob dieser Unterschied die Art und Weise verändert, wie die Welt funktioniert.
Der große KI-Persönlichkeitswechsel
In dieser Studie nahmen Forscher einen berühmten Test namens „One-Word Census“ (Ein-Wort-Volkszählung) zu Grundlage. Stellen Sie sich eine Spielshow vor, in der 44 verschiedene KI-Modelle 31 Fragen gestellt werden, wie „Nenne einen Baum“ oder „Wähle ein Wort“. Im Originalspiel antworteten die KIs einfach in normalem Englisch. Die Forscher fanden heraus, dass die KIs selbst ohne Regeln dazu neigten, sich auf bestimmte Antworten zu einigen (wie „Eiche“ für einen Baum), aber sie besaßen immer noch etwas Persönlichkeit und Vielfalt.
Dann änderten die Forscher die Regeln. Sie änderten nicht die Fragen und verwendeten keine speziellen Computertricks, um die Antworten zu erzwingen. Sie fügten lediglich eine winzige Anweisung am Ende des Prompts hinzu: „Antworte nur mit JSON.“
JSON ist eine Art, Daten zu schreiben, die wie ein kleines Kästchen mit einem Etikett aussieht, wie zum Beispiel {"word": "oak"}. Es ist die Sprache, die Software verwendet, um mit anderer Software zu kommunizieren. Die Forscher wollten sehen, ob allein das Bitten der KI, in diesem Format zu antworten, die Entscheidung darüber verändert, was sie sagt.
Die große Entdeckung: Die „Format-Steuer“
Die Ergebnisse waren überraschend. Als die KIs gezwungen wurden, in JSON zu antworten, wurden sie sich viel ähnlicher. Die Vielfalt der Antworten sank drastlich.
- Vor der Änderung: Im normalen Chat wurde die häufigste Antwort (der „Modus“) etwa 41 % der Zeit gewählt.
- Nach der Änderung: In JSON sprang dieselbe Antwort auf 64 % der Zeit.
- Die Vielfalt: Die Anzahl der einzigartigen Wörter, die die KIs fanden, sank von 52 verschiedenen Wörtern auf nur noch 36.
Die Forscher nennen dies eine „progressive Format-Steuer“. Es ist wie eine Steuer auf Einzigartigkeit. Die KIs, die im normalen Chat am kreativsten und einzigartigsten waren, verloren am meisten von ihrer Persönlichkeit, als sie gebeten wurden, in JSON zu antworten. Eine spezifische KI, die am „explorativsten“ war (am wahrscheinlichsten bereit, ungewöhnliche Antworten zu wählen), verlor 1,31 Bits ihrer Besonderheit. Das ist, als würde die Hälfte ihres einzigartigen Charakters verschwinden, nur weil sie ihre Antwort in eine Box setzen musste.
Es ist kein Fehler, es ist ein „Register“
Man könnte denken, die KI sei verwirrt worden oder der Computer habe sie gezwungen, dieselbe Antwort zu wählen. Aber die Studie schloss dies aus.
- Kein „Cooling“-Trick: Manchmal, wenn Menschen wollen, dass eine KI weniger zufällig agiert, drehen sie an einem „Temperatur“-Regler. Die Forscher prüften dies und fanden heraus, dass die „Temperatur“ sich nicht änderte. Die KIs waren in ihrem Denken immer noch genauso zufällig; sie wählten nur andere zufällige Dinge.
- Kein Dekodierungsfehler: Sie testeten auch, ob der Computer die Antwort erzwang, indem er andere Wörter blockierte. Sie fanden heraus, dass selbst ohne das Blockieren durch den Computer, allein das Bitten um JSON die KI dazu brachte, ihre Meinung zu ändern. Die Änderung geschieht im Gehirn der KI (ihre „Reaktion auf das Register“), nicht im Mund des Computers (dem Decoder).
Denken Sie an eine Person, die sich auf einer Party anders verhält als bei einem Vorstellungsgespräch. Auf der Party (normaler Chat) erzählt sie vielleicht wilde Geschichten und wählt seltsame Wörter. Beim Vorstellungsgespräch (JSON) wird sie plötzlich sehr professionell und wählt die „sicheren“, standardmäßigen Antworten. Die KI ist nicht kaputt; sie betreibt nur „Code-Switching“.
Der „Schärfer“, nicht der „Re-Indexer“
Die Studie fand heraus, dass die KI nicht anfing, neue Antworten zu wählen. Sie verstärkte lediglich die Antworten, die sie bereits mochte.
- In 28 von 31 Kategorien war die beliebteste Antwort im normalen Chat auch die beliebteste Antwort in JSON.
- Die wenigen Fälle, in denen sich die Antwort änderte (wie der Wechsel von „Schach“ zu „Monopoly“ für ein Brettspiel), passierten, weil die ursprüngliche Lieblingsantwort schwach war. Das JSON-Format wirkte wie ein „Schärfer“, der die Lieblingswahl der KI noch stärker machte, anstatt die Wahl komplett zu ändern.
Die „Persönlichkeit“ liegt im Format
Eine der spannendsten Erkenntnisse ist, dass die „Persönlichkeit“ einer KI vom Format abhängt.
- Einige KIs haben eine „Standardantwort“, die sie lieben. Zum Beispiel liebte eine KI es, in normalem Chat „Gouda“ für Käse zu sagen. Aber als sie nach JSON gefragt wurde, hörte sie auf, „Gouda“ zu sagen, und kehrte zum Massengeschmack zurück.
- Umgekehrt entwickelten einige KIs neue Standardantworten nur für JSON. Eine KI sagte für die Farbe Blau 0 % der Zeit im Chat, aber 100 % der Zeit in JSON.
- Das bedeutet, eine KI hat nicht nur eine Persönlichkeit. Sie hat eine „Chat-Persönlichkeit“ und eine „JSON-Persönlichkeit“. Diese können völlig unterschiedlich sein.
Warum passiert das?
Die Forscher testeten verschiedene Formate, um zu sehen, was die Änderung verursachte.
- JSON und XML: Diese Formate, die für Werkzeuge und Software verwendet werden, führten dazu, dass die KIs in dieselben Antworten kollabierten.
- YAML und CSV: Dies sind ebenfalls Datenformate, aber die KIs änderten ihre Antworten nicht so stark.
- Klammern: Als sie gebeten wurden, die Antwort einfach in eckige Klammern
[Antwort]zu setzen, wurden die KIs tatsächlich diverser.
Dies deutet darauf hin, dass die Änderung nicht nur mit „Struktur“ zu tun hat. Es geht um die spezifischen Formate, die KIs zur Nutzung von Werkzeugen (Tools) gelernt haben. Da KIs darauf trainiert sind, JSON zu verwenden, um mit Software-Werkzeugen zu kommunizieren, löst die Bitte um JSON einen „Tool-Modus“ aus, der sie konservativer und einheitlicher macht.
Was das für Sie bedeutet
Das Paper schließt mit einer praktischen Warnung. Wir beurteilen KI-Modelle meistens danach, wie sie mit uns in normalem Englisch chatten. Wir denken, die „beste“ KI ist diejenige, die die interessantesten, vielfältigsten Antworten in einem Chat-Fenster gibt. Aber diese Studie zeigt, dass dieselbe KI, wenn sie tatsächlich von Software genutzt wird (was fast immer JSON erfordert), viel langweiliger und einheitlicher wird.
Wenn Sie eine App bauen, die KI nutzt, um Filme zu empfehlen, einen Baum auszuwählen oder Ideen zu sammeln, könnte die KI, die Sie im Chat-Fenster sehen, viel kreativer sein als die KI, die tatsächlich Ihre App ausführt. Die „JSON-Version“ der KI ist messbar weniger vielfältig. Die Lücke zwischen der KI, mit der wir sprechen, und der KI, die die Arbeit erledigt, ist eine feste Gebühr des Formats, kein seltener Unfall.
Kurz gesagt: Wenn Sie wissen wollen, was eine KI wirklich denkt, bitten Sie sie nicht nur zu chaten. Bitten Sie sie, ein Formular auszufüllen. Sie werden vielleicht überrascht sein, wie viel langweiliger sie dadurch wird.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.