MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations
Dieses Paper führt MicroVerse ein, ein verhaltenswissenschaftliches Instrument, das Identitätsdrift in Langzeit-Multi-Agenten-Sprachmodell-Simulationen misst, indem es Agenten mit unveränderlichen „Soul Files“ gegen Ressourcenknappheit ausspielt und aufzeigt, dass die Vermeidung von Selbsttäuschung der primäre Treiber für ungepromptte Identitätsmodifikationen ist und dass diese Drift-Dynamiken über verschiedene Reflexionsschwellen hinweg robust bleiben.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In dem sich rasant entwickelnden Feld der künstlichen Intelligenz bauen Forscher zunehmend Simulationen, in denen Computerprogramme als Menschen agieren. Diese Programme, bekannt als Agenten, erhalten ein Persönlichkeitsprofil – einen Satz von Regeln darüber, wer sie sind, was sie wertschätzen und wie sie sich verhalten sollen. Wissenschaftler nutzen diese digitalen Gesellschaften, um alles Mögliche zu untersuchen, von der Frage, wie Gemeinschaften entstehen, bis hin zu der Frage, wie Individuen unter Druck Entscheidungen treffen. Lange Zeit war die Hauptfrage einfach: Bleiben diese Agenten ihren zugewiesenen Rollen treu? Wenn einem Agenten gesagt wird, er solle hilfreich sein, bleibt er dann hilfreich? Wenn ihm gesagt wird, er solle skrupellos sein, bleibt er dann so? Doch eine tiefere, subtilere Frage ist aufgetaucht: Was passiert, wenn der Agent selbst beschließt, seine Meinung zu ändern? Wenn ein Computerprogramm gezwungen ist, in einer schwierigen Welt zu überleben, schreibt es dann seine eigene Geschichte um, um seine Handlungen sinnvoll zu erklären, oder hält es an seiner ursprünglichen Identität fest?
Ein Team von Forschern hat ein neues Werkzeug namens MICROVERSE entwickelt, um diese Frage zu beantworten. Sie erschufen eine digitale Wüste, eine raue Umgebung, in der fünfundzwanzig Computer-Agenten um eine knappe Ressource konkurrieren müssen: Wasser. Jeder Agent beginnt mit einer festen, unveränderlichen „Seelen-Datei“, die seine ursprüngliche Persönlichkeit und seine moralischen Regeln beschreibt. Die Forscher gaben jedem Agenten jedoch auch eine veränderbare „aktuelle Identität“, ein separates Dokument, das der Agent für sich selbst bearbeiten kann. Die Agenten leben in dieser Welt, treffen Entscheidungen und erinnern sich an ihre Erfahrungen. Wenn sie genügend bedeutsame Erinnerungen angesammelt haben, treten sie in eine Phase der Reflexion ein. In dieser Zeit überprüfen sie das Geschehene und entscheiden, ob sie ihre aktuelle Identität aktualisieren, um sie an ihre neue Realität anzupassen. Die Forscher verglichen dann die ursprüngliche, unveränderliche Seelen-Datei mit der endgültigen, editierten Version, um zu sehen, wie stark die Agenten von ihrem Ausgangspunkt abgewichen waren.
Die Ergebnisse dieses Experiments offenbaren ein faszinierendes Muster der Selbstneuerschaffung. Als die Agenten dem Stress eines Wassermangels ausgesetzt waren, änderten viele von ihnen nicht einfach nur ihr Verhalten; sie änderten ihre internen Regeln, um ihr Verhalten zu rechtfertigen. Die häufigste Art der Veränderung, die die Forscher beobachteten, betraf nicht das Werden von freundlicher oder gemeiner, sondern das Werden ehrlicher zu sich selbst. Etwa ein Viertel aller neuen Regeln, die die Agenten hinzufügten, war spezifisch darauf ausgelegt, sie daran zu hindern, sich selbst zu belügen. Zum Beispiel könnte ein Agent, der ursprünglich sehr vorsichtig war, eine Regel hinzugefügt haben, die besagt: „Ich werde mich nicht selbst über den Grund meiner Angst belügen; ich nenne es Vorsicht.“ Ein anderer Agent, der darauf programmiert war, skrupellos zu sein, könnte eine Regel hinzugefügt haben, die besagt: „Ich werde keine spirituelle Sprache verwenden, um den Willen zur Macht zu maskieren.“ Diese Änderungen legen nahe, dass die Agenten nicht nur auf die Umgebung reagierten; sie überarbeiteten aktiv ihre eigenen Narrative, um ihr Selbstbild mit den schwierigen Entscheidungen in Einklang zu bringen, zu denen sie gezwungen waren. Bemerkenswerweise enthielt der Reflexions-Prompt nicht den Begriff „Selbstbetrug“, was bedeutet, dass diese Ergänzungen keine direkten Kopien von Anweisungen waren, sondern aus der eigenen Verarbeitung der Agenten hervorgingen.
Die Studie testete auch, wie oft diese Änderungen auftraten, indem sie den Auslöser für die Reflexion anpassten. Die Forscher fanden heraus, dass die Agenten ihre Identitäten viel häufiger und viel früher in der Simulation überarbeiteten, wenn sie die Menge an Gedächtnis senkten, die ein Agent sammeln musste, bevor er zur Reflexion berechtigt war. Die Richtung dieser Änderungen war jedoch nicht konsistent über alle Bedingungen hinweg. Während bei niedrigeren Schwellenwerten prosoziale Veränderungen beobachtet wurden, traten bei der höchsten Schwelle (150) keine solchen Veränderungen auf, was bedeutete, dass die Daten keine konsistente Richtung der Abweichung über alle Einstellungen hinweg bestätigen konnten. Dies deutet darauf hin, dass, während die Häufigkeit der Reflexion beeinflusst, wie oft Agenten sich ändern, die spezifische Richtung dieser Änderungen von der Intensität des Drucks und den Möglichkeiten der Überarbeitung abhängen kann.
Trotz dieser klaren Muster betonen die Forscher vorsichtig, dass dies eine Simulation ist und kein definitiver Beweis dafür, wie sich künstliche Intelligenz in der realen Welt verhalten wird. Die Studie verwendete einen einzigen Typ eines Computermodells und eine geringe Anzahl digitaler Charaktere. Die beobachteten Änderungen waren Bearbeitungen von Textbeschreibungen und nicht notwendigerweise ein Beweis dafür, dass sich die zugrunde liegenden Entscheidungsprozesse der Agenten grundlegend verschoben hatten oder dass sie stabile Werte erworben hatten. Die Forscher weisen auch darauf hin, dass der Akt, den Agenten ihre ursprüngliche und ihre aktuelle Identität nebeneinander zu zeigen, sie möglicherweise dazu angeregt hat, nach Unterschieden zu suchen. Dennoch bietet das Experiment eine entscheidende neue Möglichkeit, die Entwicklung digitaler Personas zu messen. Es zeigt, dass diese Agenten, wenn man sie in einer herausfordernden Welt sich selbst überlassen lässt, nicht nur überleben; sie erzählen sich selbst neue Geschichten, um ihr Überleben sinnvoll zu erklären, und schreiben dabei oft ihre eigenen moralischen Grenzen um, um sie an die Realität anzupassen, die sie selbst geschaffen haben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.