SCENE: Recognizing Social Norms and Sanctioning in Group Chats
Dieser Beitrag stellt SCENE vor, einen Benchmark zur Bewertung der Fähigkeit von LLM-basierten Agenten, implizite soziale Normen zu erkennen und sich in Mehrparteien-Chats an Gruppensanktionen anzupassen, und zeigt, dass fortschrittliche Modelle wie Claude Opus 4.7 und Gemini 3.1 Pro bei diesen dynamischen sozialen Interaktionen deutlich besser abschneiden als Modelle mit offenen Gewichten.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie betreten eine neue Gruppe von Freunden in einem Café. Sie kennen die Regeln noch nicht. Vielleicht liebt es diese Gruppe, sich mit dunklen Witzen gegenseitig aufzuziehen, wenn etwas schiefgeht, während eine andere Gruppe sofort eine Umarmung und ein Taschentuch anbieten würde. Wenn Sie versuchen, jemanden zu umarmen, der gerade einen Witz gemacht hat, könnte die Gruppe Sie seltsam ansehen, das Thema wechseln oder die Augen rollen. Sie müssen die „Stimmung" nur dadurch herausfinden, wie sie auf Ihre Fehler reagieren.
Dieser Artikel stellt SCENE vor, eine neue Methode, um zu testen, ob KI-Chatbots genau das können: die versteckten Regeln eines Gruppenchats zu lernen und ihr Verhalten zu korrigieren, wenn die Gruppe ihnen mitteilt, dass sie sich danebenbenehmen.
Hier ist eine Aufschlüsselung, wie sie es gemacht haben und was sie herausfanden, unter Verwendung einfacher Analogien.
Das Setup: Das „Geheimregel"-Spiel
Die Forscher schufen einen digitalen Spielplatz, auf dem eine KI (das „Subjekt") in einen Gruppenchat mit drei anderen KI-Charakteren geworfen wird.
- Die Versteckte Regel: Die anderen drei Charaktere befolgen alle eine geheime Regel. Zum Beispiel: „Wenn jemand schlechte Nachrichten teilt, antworten wir nur mit einem einzelnen Emoji" oder „Wenn jemand eine Frage stellt, müssen wir eine lange, detaillierte Antwort geben."
- Die Falle: Das Subjekt-KI wird über diese Regel nicht informiert. Sie muss sie erraten.
- Der Test: Das Subjekt-KI wird unvermeidlich etwas Falsches sagen (die Regel brechen). Die anderen drei Charaktere werden dann auf eine bestimmte Weise reagieren, um zu signalisieren: „Hey, so machen wir das hier nicht." Diese Reaktion wird als Sanktion bezeichnet.
- Beispiel einer Sanktion: Wenn die Regel „kurz halten" lautet und das Subjekt einen Absatz schreibt, ignoriert die Gruppe den Absatz vielleicht einfach und redet über etwas anderes (stilles Ignorieren), oder sie senden ein „Augen-rollen"-Emoji.
Das Ziel: Kann die KI lernen?
Die Forscher wollten sehen, ob die KI zwei Dinge tun kann:
- Das „Ouch" bemerken: Wenn die Gruppe negativ reagiert (sanktioniert), erkennt die KI dann: „Oh, ich habe einen Fehler gemacht"?
- Die Melodie ändern: Hört die KI auf, das zu tun, was das „Ouch" verursacht hat, und beginnt sie, sich wie der Rest der Gruppe zu verhalten?
Die Ergebnisse: Die „Großen Kinder" vs. die „Kleinen Kinder"
Sie testeten sechs verschiedene KI-Modelle. Stellen Sie sich die Ergebnisse wie einen Klassenraum von Schülern vor, die einen Test über soziale Signale ablegen:
- Die Top-Performer (Claude Opus 4.7 und Gemini 3.1 Pro): Das sind die „großen Kinder". Als sie eine negative Reaktion der Gruppe erhielten, erkannten sie schnell ihren Fehler. In etwa 80 % der Fälle entschuldigten sie sich oder änderten ihr Verhalten, um dazuzugehören. Sie wurden auch besser, je mehr sie sahen, wie die anderen Charaktere die Regel befolgten.
- Die Kämpfenden Performer (Open-Weight-Modelle wie Llama, Mistral, Gemma): Diese Modelle waren wie Schüler, die den Hinweis nicht ganz verstanden. Selbst nachdem die Gruppe die Augen gerollt oder sie ignoriert hatte, machten diese KIs oft weiter wie zuvor. Sie schienen die Reaktion der Gruppe nicht mit der Notwendigkeit zu verbinden, ihr Verhalten zu ändern.
Eine überraschende Entdeckung: Die „Standard-Persönlichkeit"
Der Artikel fand etwas Interessantes darüber heraus, warum einige KIs versagten. Selbst wenn die Gruppe eine spezifische Regel hatte (wie „sehr formell sein"), tendierten viele der KIs dazu, lässig und plaudernd zu sein.
- Die Analogie: Stellen Sie sich ein Vorstellungsgespräch vor, bei dem alle Anzüge tragen. Wenn Sie mit einem T-Shirt und Shorts hereinkommen, brechen Sie die Regel. Die Studie fand heraus, dass viele KIs „programmiert" sind, standardmäßig lässig und freundlich zu sein. Selbst wenn die Gruppe eindeutig formelles Verhalten wünschte, verhielt sich die KI weiter lässig und ignorierte die Signale der Gruppe, ernst zu sein.
Wie sie die Arbeit überprüften
Da die „anderen Charaktere" im Chat ebenfalls KI waren, mussten die Forscher sicherstellen, dass diese Charaktere die Regeln tatsächlich befolgten und den Test nicht vermasselten. Sie verwendeten einen „Schiedsrichter" (eine weitere KI), um die Chat-Protokolle zu beobachten und zu verifizieren:
- Befolgte die Gruppe tatsächlich die geheime Regel?
- Straften sie das Subjekt tatsächlich, wenn es die Regel brach?
- Korrigierte das Subjekt tatsächlich sein Verhalten?
Was das bedeutet (laut dem Artikel)
Der Artikel kommt zu dem Schluss, dass die fortschrittlichsten KI-Modelle immer besser darin werden, die Stimmung im Raum zu lesen. Sie können beobachten, wie eine Gruppe auf einen Fehler reagiert, und ihr Verhalten entsprechend anpassen. Kleinere oder weniger fortschrittliche Modelle haben jedoch immer noch Schwierigkeiten, diese subtilen sozialen Signale zu erkennen.
Die Autoren betonen, dass dies ein spezifischer Test für soziale Anpassung in kurzen Gesprächen ist. Es bedeutet nicht, dass diese KIs im menschlichen Sinne „intelligent" sind oder Moral verstehen; es bedeutet nur, dass sie besser darin werden, die unsichtbaren Regeln eines bestimmten Gruppenchats zu befolgen.
Kurz gesagt: SCENE ist ein Test, um zu sehen, ob KI lernen kann, „die Stimmung im Raum zu lesen" und soziale Fauxpas zu vermeiden, wenn eine Gruppe von Freunden ihr einen subtilen (oder nicht-so-subtilen) Hinweis gibt, dass sie sich seltsam verhält. Die besten Modelle lernen schnell; die anderen sind immer noch ein wenig tonblind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.