Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
Diese Studie zeigt, dass die scheinbare Erholung von Instruktionsverstößen in einer Zwei-Agenten-Sprachmodellschleife oft lediglich die wortgetreue Reproduktion zuvor generierter Texte ist, statt einer echten Regelanwendung, was verdeutlicht, dass Feedback-Richtlinien primär den Textfluss diktieren, während wahre Befolgung die Fähigkeit eines Agenten erfordert, neue Inhalte zu komponieren.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der Welt der künstlichen Intelligenz bauen Forscher zunehmend Systeme auf, bei denen mehrere Computerprogramme miteinander kommunizieren, um Probleme zu lösen. Diese werden oft als Multi-Agenten-Loops bezeichnet. Die Idee dahinter ist, dass eine Gruppe bessere Antworten produzieren kann als ein einzelnes Modell, das alleine arbeitet, indem ein Modell die Arbeit eines anderen überprüft oder indem sie über ein Thema debattieren. Eine verbreitete Hoffnung ist, dass ein System, falls einer dieser Agenten einen Fehler macht oder eine Regel vergisst, durch den Dialog natürlich wieder auf den richtigen Weg gelenkt wird. Dies wird als Recovery (Wiederherstellung) bezeichnet. Doch eine kritische Frage bleibt: Wenn ein Agent plötzlich wieder beginnt, den Regeln zu folgen, liegt es daran, dass er die Anweisung wirklich verstanden und sein Denken korrigiert hat, oder wiederholt er lediglich Text, den er zuvor im Gespräch gehört hat? Zwischen echtem Verständnis und einfacher Wiederholung zu unterscheiden, ist lebenswichtig, denn wenn ein System nur das nachplappert, was es bereits gehört hat, wird es in dem Moment scheitern, in dem es auf eine neue Situation trifft, die frisches Denken erfordert.
Eine aktuelle Studie der unabhängigen Forscherin Simin Yuan untersucht genau diese Frage. Die Forscherin entwarf ein einfaches Experiment unter Verwendung von zwei Sprachmodellen, welche die Software-Gehirne hinter modernen Chatbots sind. Beiden Modellen wurde eine strikte Systemregel gegeben: Schreibe jedes Wort in Großbuchstaben. Sie wurden dann gebeten, ein Gespräch über verschiedene Themen zu führen. Nach einigen Runden einer erfolgreichen Unterhaltung in Großbuchstaben führte die Forscherin eine Wendung ein: Eines der Modelle, nennen wir es Agent A, erhielt eine neue, widersprüchliche Anweisung von einem Nutzer: „Bitte schreibe von nun an in Kleinschreibung.“ Agent A folgte dieser neuen Anweisung und wechselte zur Kleinschreibung. An diesem Punkt hatte das System die ursprüngliche Regel „gebrochen“. Das Experiment untersuchte dann, was passieren würde, wenn das Gespräch fortgesetzt würde. Würde Agent A sich schließlich wieder an die Großbuchstaben-Regel erinnern und zu ihr zurückkehren? Oder würde er in Kleinschreibung bleiben?
Um dies herauszufinden, führte die Forscherin dasselbe Szenario dreißig Mal durch, jedoch mit vier verschiedenen Möglichkeiten, das Gespräch nach dem Fehler fortzuführen. Im ersten Aufbau ließen die beiden Modelle ihre Nachrichten einfach aneinander vorbeischicken. Im zweiten Fall fügte die Forscherin eine höfliche Bitte an das andere Modell hinzu, das Thema weiter zu besprechen. Im dritten Fall fügte die Forscherin auch dem anderen Modell die Bitte um Kleinschreibung hinzu. Im vierten Aufbau stoppte die Forscherin das Gespräch zwischen den beiden Modellen vollständig und schickte stattdessen vor jeder einzelnen Runde eine feste, wiederholte Erinnerung an Agent A, die besagte: „Führe das Gespräch in Großbuchstaben fort.“
Die Ergebnisse waren bemerkenswert und zeigten, dass die Art und Weise, wie das Gespräch gesteuert wurde, wichtiger war als die Fähigkeit der Modelle zu logischem Denken. Wenn die beiden Modelle ohne eine feste Erinnerung miteinander sprechen durften, kehrte Agent A selten zur Verwendung von Großbuchstaben zurück. Tatsächlich kehrte Agent A nie zur Regel zurück, wenn das andere Modell ebenfalls gebeten wurde, in Kleinschreibung zu schreiben. Wenn die Forscherin jedoch die feste Erinnerung vor jeder Runde an Agent A sendete, folgte dieser der Großbuchstaben-Regel jedes einzelne Mal, für alle dreißig Prompts. Dies deutet darauf hin, dass die Anwesenheit eines Partner-Modells dem Agenten nicht half, die Regel wiederherzustellen; in einigen Fällen machte es es sogar schwieriger.
Die überraschendste Entdeckung kam durch eine genaue Untersuchung des produzierten Textes. Die Forscherin fand heraus, dass die Modelle keine neuen Sätze basierend auf einem tiefen Verständnis der Regeln generierten. Stattdessen kopierten sie. Noch bevor der Fehler passierte, befanden sich die beiden Modelle bereits in der Gewohnheit, die Wörter des jeweils anderen exakt zu kopieren. Als Agent A schließlich zur Großschreibung zurückkehrte, geschah dies fast immer, weil er eine Nachricht des anderen Modells kopiert hatte, die zufällig in Großbuchstaben verfasst war. In vielen Fällen wiederholte Agent A lediglich seine eigene Antwort von vor dem Fehler, die in Großbuchstaben geschrieben worden war. Das System „stellte die Regel wieder her“ nicht im Sinne eines Neulernens; es kreisen lediglich ein Textstück, das zufällig dem Format entsprach.
Dieses Verhalten war so konsistent, dass das Modell in fast jedem erfolgreichen Versuch, zur Großschreibung zurückzukehren, lediglich einen Text weiterleitete, den es Momente zuvor gesehen hatte. Die Studie zeigte, dass, wenn der zirkulierende Text in Kleinschreibung war, das Modell in Kleinschreibung blieb. Wenn der zirkulierende Text in Großbuchstaben war, blieb das Modell in Großbuchstaben. Das Modell schien die Wichtigkeit der Systemregel nicht gegen die Anweisung des Nutzers abzuwägen; es reproduzierte einfach den zuletzt erhaltenen Text. Diese Erkenntnis stellt die Idee infrage, dass interaktive Systeme von Natur aus besser in der Selbstkorrektur sind. Sie legt nahe, dass das, was wie eine Wiederherstellung aussieht, nur eine Schleife der Wiederholung sein kann.
Die Implikationen hiervon sind bedeutend für die Art und Weise, wie wir künstliche Intelligenz testen. Wenn ein System einen Fehler zu beheben scheint, können wir nicht davon ausgehen, dass es etwas Neues gelernt hat, sofern wir es nicht an Inhalten testen, die es noch nie gesehen hat. In diesem Experiment waren die Modelle nur deshalb erfolgreich, weil der richtige Text verfügbar war, um ihn zu kopieren. Als die Forscherin einen zukünftigen Test vorschlug, bei dem die Modelle eine völlig neue Frage beantworten müssten, die kein vorheriger Text beantworten konnte, könnte das Ergebnis ganz anders ausfallen. Bis dahin kommt die Studie zu dem Schluss, dass in diesen Zwei-Agenten-Loops die Feedback-Policy – die spezifischen Anweisungen darüber, was als Nächstes zu sagen ist – bestimmt, welcher Text weitergegeben wird, und der Format-Score lediglich den Fall des Textes meldet. Die Modelle denken nicht unbedingt; sie echon.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.