← Neueste Arbeiten
📊 statistics

Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback

Dieses Paper schlägt ein einheitliches Offline-RLHF-Framework für pluralistische Ausrichtung vor, das parteispezifische Belohnungen unter einem Low-Rank-Linearmodell gemeinsam schätzt und Politiken für Nash-, utilitaristische und egalitäre Ziele optimiert, während es gleichzeitig allgemeine zyklische Präferenzen über einen pessimistischen von Neumann-Gewinner adressiert, alles unter Einhaltung etablierter nicht-asymptotischer Leistungsgarantien.

Ursprüngliche Autoren: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

Veröffentlicht 2026-09-09
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der künstlichen Intelligenz wächst die Erkenntnis, dass Maschinen nicht mit einer einzigen menschlichen Stimme sprechen. Wenn wir einen Computer bitten, eine Geschichte zu schreiben, einen Nachrichtenartikel zusammenzufassen oder einen Rat zu geben, wollen unterschiedliche Menschen oft unterschiedliche Dinge. Eine Person legt vielleicht Wert auf Kürze und Direktheit, während eine andere Nuancen und emotionale Tiefe bevorzugt. Ein Dritter priorisiert vielleicht Sicherheit über alles andere, während ein Vierter nach Kreativität strebt. Jahrelang bestand die Standardmethode, diese Maschinen zu lehren darin, all diese verschiedenen Meinungen zu sammeln, sie zu einem großen Haufen zu vermischen und das System darauf zu trainieren, den Durchschnitt zu befriedigen. Dieser Ansatz setzt voraus, dass menschliche Uneinigkeit nur Rauschen ist – eine vorübergehende Verwirrung, die verschwinden wird, wenn wir nur genug Daten sammeln. In der Realität sind diese Unterschiede jedoch oft tiefgreifend, beständig und fundamental. Sie repräsentieren echte Konflikte in den Werten, nicht bloß zufällige Fehler. Die Herausforderung für Wissenschaftler besteht nicht mehr nur darin, eine Maschine zu bauen, die der Mehrheit gefällt, sondern eine zu erschaffen, die aus einer Menge distinkter, manchmal gegensätzlicher Standpunkte lernen und dennoch zu einer einzigen, fairen Entscheidung gelangen kann, welche die Struktur dieser Uneinigkeit respektiert.

Dies ist das zentrale Problem, das ein Team von Forschern von Institutionen wie dem MIT, der University of North Carolina und der Carnegie Mellon University angeht. Sie haben sich darauf konzentriert, ein spezifisches Rätsel im Bereich des maschinellen Lernens zu lösen, das als „pluralistische Ausrichtung“ (pluralistic alignment) bekannt ist. Stellen Sie sich einen Raum voller Menschen vor, die versuchen, über eine einzige Maßnahme zu entscheiden, aber sie können sich nicht darauf einigen, wie das beste Ergebnis aussieht. In der Vergangenheit hätten Informatiker einfach jeden über jede mögliche Wahl abstimmen lassen, die Stimmen gezählt und den Gewinner ermittelt. Der neue Ansatz, der in dieser Arbeit beschrieben wird, argumenttiert, dass diese Methode zu viele Informationen wegwirft. Wenn man die Stimmen einer Gruppe, die scharfes Essen liebt, mit den Stimmen einer Gruppe mischt, die es hasst, könnte man am Ende bei einem fad und unbefriedigend kompromisshaften Ergebnis landen, das niemanden glücklich macht. Stattdessen schlagen die Forscher eine Methode vor, die die Gruppen während des Lernens getrennt hält, genau versteht, was jede Gruppe will, und dann eine spezifische, transparente Regel anwendet, um diese Wünsche zu einer einzigen endgültigen Entscheidung zu kombinieren.

Die Forscher konzentrierten sich auf ein Szenario, in dem der Computer aus „Offline“-Daten lernt. Das bedeutet, dass die Maschine nicht in Echtzeit mit Menschen spricht, sondern eine riesige, bereits existierende Sammlung von Datensätzen betrachtet. In diesen Aufzeichnungen haben Menschen zwei verschiedene Optionen verglichen und angegeben, welche sie bevorzugt haben. Entscheidend ist, dass die Forscher sicherstellten, dass die Daten festhielten, wer jeden Vergleich getätigt hatte. Es wurde nicht nur aufgezeichnet, dass „Option A besser als Option B war“, sondern dass „Gruppe A Option A bevorzugte, während Gruppe B Option B bevorzugte“. Durch die Bewahrung dieser Identitäten konnte der Computer die spezifischen Präferenzen jeder einzelnen Gruppe lernen, anstatt sie zu einem einzigen, verwirrten Durchschnitt zu verschleiern.

Um diese Komplexität zu bewältigen, entwickelte das Team einen mathematischen Rahmen, der in zwei Hauptphasen arbeitet. Zuerst lernt das System die verborgenen Regeln, die die Präferenzen jeder Gruppe antreiben. Sie entdeckten, dass die Gruppen zwar unterschiedliche Dinge wollen, ihre Präferenzen aber oft eine gemeinsame zugrunde liegende Struktur teilen, ganz ähnlich wie verschiedene Sprachen eine gemeinsame Grammatik besitzen. Durch das Erkennen dieser gemeinsamen Struktur kann der Computer die spezifischen Wünsche vieler verschiedener Gruppen mit weit weniger Daten lernen, als wenn er versuchen würde, jede einzelne isoliert zu lernen. Dieser Schritt ist entscheidend, da er es dem System ermöglicht, selbst dann präzise zu sein, wenn die Daten für eine einzelne Gruppe spärlich oder unvollständig sind.

Sobald das System versteht, was jede Gruppe will, geht es zur zweiten Phase über: der endgültigen Entscheidung. Hier testeten die Forscher drei verschiedene Wege, diese Präferenzen zu kombinieren, die jeweils unterschiedliche Vorstellungen von Fairness repräsentieren. Eine Methode, genannt „utilitaristisch“, addiert einfach das gesamte Glück aller Gruppen und wählt die Option, die das größte Gesamtwohl schafft. Eine andere, genannt „egalitär“, konzentriert sich ausschließlich auf die Gruppe, die am wenigsten zufrieden ist, um sicherzustellen, dass die am schlechtesten gestellte Gruppe so glücklich wie möglich gemacht wird. Die dritte Methode, bekannt als „Nash“, sucht nach einem Gleichgewicht, bei dem das Produkt der Zufriedenheit aller maximiert wird, was effektiv verhindert, dass eine einzelne Gruppe völlig ignoriert wird, während gleichzeitig der allgemeine Fortschritt belohnt wird. Die Forscher bewiesen mathematisch, dass ihre Methode eine einzige Strategie finden kann, die unter all diesen Definitionen von Fairness gut abschneidet, sofern die Daten ausreichend sind.

Eine zentrale Erkenntnis der Studie ist, dass das bloße Zusammenführen aller Daten und das Ignorieren dessen, wer was gesagt hat, zu einem schlechten Ergebnis führt. Als die Forscher ein Szenario mit drei distinkten Gruppen von Menschen simulierten, scheiterte die traditionelle „gepoolte“ Methode daran, einen fairen Kompromiss zu finden. Sie wählte oft eine Option, die von einer Gruppe geliebt, aber von den anderen gehasst wurde, wodurch die Hälfte der Bevölkerung völlig unzufrieden zurückblieb. Im Gegensatz dazu identifizierte ihre neue Methode, die die Gruppen während der Lernphase getrennt hielt, erfolgreich eine Mittelweg-Option, die allen Beteiligten ein moderates Maß an Zufriedenheit bot. Dies demonstrierte, dass die Schwierigkeit bei der Ausrichtung künstlicher Intelligenz nicht nur darin besteht, genug Daten zu haben, sondern darin, die Struktur der menschlichen Uneinigkeit zu bewahren, bis eine klare, intentionale Entscheidung über deren Lösung getroffen wird.

Die Forscher untersuchten auch ein schwierigeres Szenario, in dem menschliche Präferenzen nicht einfach auf einen Score oder ein Ranking reduziert werden können. Manchmal sind die Entscheidungen von Menschen inkonsistent; sie bevorzugen vielleicht A gegenüber B, B gegenüber C, aber dann C gegenüber A. In solchen Fällen bricht die Standardmethode, jedem Punkt eine einzige Zahl zuzuweisen, zusammen. Um dies zu handhaben, entwickelte das Team eine neue Strategie basierend auf dem Konzept eines „von Neumann-Gewinners“. Dies ist ein probabilistischer Ansatz, bei dem das System nicht versucht, die eine beste Option zu finden, sondern eine Strategie, die in einem direkten Vergleich gegen jede andere Strategie unwahrscheinlich verlieren würde. Sie bewiesen, dass ihr Verfahren selbst in diesen chaotischen, inkonsistenten Situationen eine stabile, faire Lösung finden kann, die die Präferenzen aller Parteien respektiert, vorausgesetzt, die Daten wurden mit ausreichender Sorgfalt erhoben.

Durch Computersimulationen zeigten die Forscher, dass ihr Ansatz bestehende Methoden konsequent übertrifft. Als sie ihren Algorithmus mit synthetischen Daten mit variierenden Zahlen von Menschen und unterschiedlichen Graden an Übereinstimmung testeten, produzierte die neue Methode Entscheidungen, die näher am idealen Ergebnis für jede Gruppe lagen. Die Simulationen bestätigten, dass das System durch die Beibehaltung der Identitäten der Gruppen und die Nutzung einer gemeinsamen Lernstruktur effizienter lernen und fairere Entscheidungen treffen kann. Die Ergebnisse blieben bestehen, egal ob das Ziel darin bestand, das durchschnittliche Glück zu maximieren, die am stärksten gefährdete Gruppe zu schützen oder einen ausgewogenen Kompromiss zu finden.

Diese Arbeit stellt einen bedeutenden Schritt nach vorn dar, wie wir darüber nachdenken, künstliche Intelligenz darauf zu trainieren, mit vielfältigen menschlichen Gesellschaften zu interagieren. Sie bewegt sich weg von der Vorstellung, dass es einen einzigen „korrekten“ Weg des Verhaltens gibt, den die Maschine entdecken muss. Stattdessen behandelt sie die Vielfalt der menschlichen Meinung als ein Merkmal, das verwaltet werden muss, und nicht als einen Fehler, der behoben werden muss. Indem sie den Prozess der Kombination verschiedener Standpunkte explizit und mathematisch rigoros gestalten, haben die Forscher einen Bauplan geliefert, um Systeme zu bauen, die Konflikte navigieren können, ohne die distinkten Stimmen auszulöschen, die sie erzeugen. Die Studie behauptet nicht, jedes Problem der Mensch-KI-Interaktion gelöst zu haben, bietet aber einen bewährten, zuverlässigen Weg, aus einer Menge uneiniger Menschen zu lernen und eine einzige, kollektive Entscheidung zu treffen, die statistisch fundiert und ethisch transparent ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →