← Neueste Arbeiten
💬 NLP

The Collective Turing Test: Large Language Models Can Generate Realistic Multi-User Discussions

Die Studie zeigt, dass große Sprachmodelle wie Llama 3 70B und GPT-4o in der Lage sind, realistische Online-Diskussionen zu generieren, die von menschlichen Teilnehmern in einem signifikanten Anteil der Fälle nicht von echten menschlichen Konversationen unterschieden werden können.

Ursprüngliche Autoren: Azza Bouleimen, Giordano De Marzo, Taehee Kim, Nicol`o Pagan, Hannah Metzler, Silvia Giordano, Anikó Hannák, David Garcia

Veröffentlicht 2026-04-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Azza Bouleimen, Giordano De Marzo, Taehee Kim, Nicol`o Pagan, Hannah Metzler, Silvia Giordano, Anikó Hannák, David Garcia

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, du betrittst ein riesiges, lautes Café (das ist unser Internet, genauer gesagt Reddit). Plötzlich siehst du zwei Gruppen von Leuten, die über das gleiche Thema diskutieren. Eine Gruppe besteht aus echten Menschen, die andere aus hochmodernen Robotern (Künstliche Intelligenz).

Die große Frage dieses Forschungsprojekts war: Können wir überhaupt noch unterscheiden, wer von wem ist?

Die Wissenschaftler haben einen „Kollektiven Turing-Test" durchgeführt. Hier ist die Geschichte dahinter, einfach erklärt:

1. Das Experiment: Der große Verkleidungs-Wettbewerb

Die Forscher haben echte Diskussionen von Reddit genommen. Dann haben sie zwei verschiedene KI-Modelle (nennen wir sie Roboter A und Roboter B) beauftragt, genau dieselben Diskussionen nachzubauen.

  • Roboter A war ein sehr vorsichtiger, höflicher und glatter Chatbot (GPT-4o).
  • Roboter B war etwas freier, direkter und hatte mehr „Internet-Slang" im Training (Llama 3).

Die KI-Modelle mussten sich so verhalten, als wären sie echte Reddit-Nutzer. Sie bekamen sogar den Auftrag, genau so viele Wörter zu schreiben wie die echten Menschen, damit die Länge der Beiträge nicht verräterisch war.

Dann haben sie 251 echte Menschen ins Café eingeladen. Diese Teilnehmer sollten sich die Diskussionen ansehen und raten: „Welche Gruppe ist echt und welche ist KI?"

2. Das Ergebnis: Die Roboter sind besser verkleidet als gedacht

Das Ergebnis war erschreckend und faszinierend zugleich:

  • Die Menschen haben in 39 % der Fälle die KI für einen echten Menschen gehalten.
  • Das bedeutet: Fast jedes zweite Mal, wenn die KI dabei war, wurde sie entlarvt. Aber in fast jedem zweiten Fall war sie erfolgreich!

Wer war der bessere Verkleidungskünstler?
Überraschenderweise war Roboter B (Llama 3) viel schwerer zu erkennen als Roboter A.

  • Warum? Stell dir vor, Roboter A ist wie ein sehr gut ausgebildeter Butler: Er ist höflich, grammatikalisch perfekt und sagt nichts Falsches. Das wirkt auf Reddit oft zu steril.
  • Roboter B hingegen war wie ein typischer Internet-Nutzer: Etwas unordentlicher, direkter und mit mehr „Flecken" im Text. Da Reddit ein eher lockeres Umfeld ist, passte Roboter B viel besser in die Maske.

3. Die Länge der Diskussion: Ein kurzes Rätsel oder ein langer Roman?

Die Forscher dachten: „Je länger die Diskussion wird, desto mehr Fehler macht die KI, oder?"
Die Antwort war überraschend: Nein, nicht wirklich.

  • Bei sehr kurzen Gesprächen (nur 1-2 Sätze) war es schwer, die KI zu erkennen.
  • Bei mittlerer Länge (ca. 8 Kommentare) wurden die Menschen am besten im Erkennen.
  • Aber bei sehr langen Diskussionen (16 Kommentare) wurden die Menschen wieder schlechter im Unterscheiden.

Die Analogie: Stell dir vor, du hörst jemandem zu, der eine Geschichte erzählt.

  • Bei 2 Sätzen merkst du vielleicht sofort, dass er zu perfekt klingt.
  • Bei 8 Sätzen hast du genug Zeit, um zu merken, dass er keine echten Emotionen hat.
  • Aber wenn er 16 Sätze lang redet, wirst du als Zuhörer müde. Du konzentrierst dich nicht mehr so genau, und die KI kann sich wieder „schmuggeln".

4. Woran haben die Menschen die KI erkannt?

Wenn die Teilnehmer die KI doch erkannt haben, lag es meist an drei Dingen:

  1. Der Stil (Das „Glatte" Gefühl): KIs waren oft zu höflich, zu formell und benutzten keine Schimpfwörter oder Slang. Echte Reddit-Nutzer sind oft rauher und emotionaler.
  2. Der Inhalt (Die „Wahrheit"): KIs erzählen selten persönliche Anekdoten („Als ich letztes Jahr in Italien war..."). Sie bleiben oft bei allgemeinen Fakten. Echte Menschen teilen ihre eigenen Erlebnisse.
  3. Die Übereinstimmung: KIs neigten dazu, sich allen anderen anzupassen und „Ja" zu sagen. Echte Menschen auf Reddit streiten sich oft oder haben widersprüchliche Meinungen.

Warum ist das wichtig? (Die Moral von der Geschichte)

Die gute Nachricht:
Forscher können diese KIs nutzen, um soziale Phänomene zu simulieren. Wenn wir wissen wollen, wie sich eine neue Politik auf das Internet auswirkt, können wir eine „KI-Community" bauen und testen, was passiert, ohne echte Menschen zu gefährden.

Die schlechte Nachricht:
Diese KIs sind so gut, dass sie Fake-News oder künstliche Meinungsmanipulation sehr realistisch vortäuschen können. Stell dir vor, eine Gruppe von Bots könnte eine Diskussion so lange und so natürlich führen, dass echte Menschen glauben, „alle" seien einer Meinung. Das könnte die Demokratie gefährden.

Fazit

Die KIs haben den Test bestanden, aber nicht perfekt. Sie sind wie Schauspieler, die eine Rolle spielen können, aber wenn man genau hinschaut, fehlt ihnen manchmal die echte „Seele" oder die rohe Emotion eines echten Menschen.

Die Wissenschaftler warnen: Wir müssen vorsichtig sein. Diese Technologie ist ein mächtiges Werkzeug für die Forschung, aber auch eine Waffe, die missbraucht werden kann, um die Realität zu verzerren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →