← Nieuwste papers
💬 NLP

The Collective Turing Test: Large Language Models Can Generate Realistic Multi-User Discussions

Dit onderzoek toont aan dat grote taalmodellen zoals Llama 3 en GPT-4o realistische online discussies kunnen genereren die door mensen in 39% van de gevallen niet van menselijke conversaties te onderscheiden zijn, wat zowel potentieel voor sociale simulatie als risico's voor misbruik benadrukt.

Oorspronkelijke auteurs: Azza Bouleimen, Giordano De Marzo, Taehee Kim, Nicol`o Pagan, Hannah Metzler, Silvia Giordano, Anikó Hannák, David Garcia

Gepubliceerd 2026-04-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Azza Bouleimen, Giordano De Marzo, Taehee Kim, Nicol`o Pagan, Hannah Metzler, Silvia Giordano, Anikó Hannák, David Garcia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Collectieve Turing-test": Kunnen robots nu net zo goed praten als wij?

Stel je voor dat je op een drukke markt staat. Je hoort twee groepen mensen die over hetzelfde onderwerp discussiëren. De ene groep bestaat uit echte mensen, de andere uit robots die zo goed nagebootst zijn dat ze eruitzien als mensen. De vraag is: kun jij het verschil horen?

Dat is precies wat deze onderzoekers hebben onderzocht. Ze wilden weten of moderne kunstmatige intelligentie (AI), zoals de bekende chatbots, zo goed kan praten in een online discussie dat echte mensen het niet meer kunnen onderscheiden van een echte menselijke discussie.

1. Het Experiment: Een "Blind Test" voor Chatbots

De onderzoekers deden iets slimme:

  • De echte mensen: Ze namen echte discussies van Reddit (een grote website waar mensen praten) en hielden die als "controle".
  • De robots: Ze lieten twee verschillende AI-modellen (namelijk Llama 3 en GPT-4o) precies dezelfde onderwerpen bespreken. Ze gaven de robots de opdracht om net zo lang te antwoorden als de echte mensen.
  • De proefpersonen: Ze vroegen 200 mensen om naar twee discussies te kijken (één van de echte mensen, één van de robots) en te raden: "Welke van deze twee is van een mens?"

Het resultaat? De mensen zaten er 39% van de tijd naast.
Dat betekent dat de AI zo goed deed dat bijna 4 op de 10 keer dachten de mensen: "Oh, dit is een echte mens!" terwijl het eigenlijk een robot was.

2. De Sterke Speler: Llama 3 vs. GPT-4o

In deze test was er een verrassende winnaar.

  • GPT-4o (een zeer bekende, slimme AI) deed het goed, maar de mensen konden het vaak nog wel doorzien.
  • Llama 3 (een ander model) was echter nog beter in het nadoen van mensen. De mensen hadden veel meer moeite om dit model te ontmaskeren.

Waarom?
Stel je voor dat GPT-4o een zeer beleefde, perfect opgeleide leraar is die altijd netjes en correct praat. Llama 3 is daarentegen meer als een vriendje die op een café zit. Het praat wat informeler, maakt soms kleine foutjes en gebruikt slang. Omdat Reddit-discussies vaak informeel en soms wat ruw zijn, paste Llama 3 zich beter aan dan de "perfecte" leraar.

3. Hoe lang moet de discussie zijn?

De onderzoekers dachten: "Als de discussie heel lang is, vallen de fouten van de robot vast sneller op."
Maar het bleek niet zo simpel.

  • Bij heel korte discussies (1 of 2 zinnen) was het lastig om het verschil te zien.
  • Bij een gemiddelde lengte (ongeveer 8 berichten) konden mensen het verschil het beste zien.
  • Bij zeer lange discussies (16 berichten) werden de mensen weer slordig of moe, en dachten ze weer dat het mensen waren.

Het is alsof je een film kijkt: bij een korte scène zie je direct als het nep is, maar bij een hele lange film word je soms zo meegesleept in het verhaal dat je de foutjes over het hoofd ziet.

4. Waar zagen mensen het verschil?

De onderzoekers vroegen de mensen: "Waarom dacht je dat dit een robot was?" De meesten gaven drie redenen:

  1. De stijl: Robot-antwoorden waren vaak te beleefd, te netjes en hadden geen scheldwoorden of grappige opmerkingen. Echte mensen op Reddit zijn vaak ruwer en emotioneler.
  2. De inhoud: Robots gaven vaak te veel uitleg of waren te "ja-knikkend". Echte mensen hebben een eigen mening, vertellen persoonlijke verhalen en zijn soms oneerlijk of emotioneel.
  3. De lengte: Soms waren de robot-antwoorden gewoon te langdradig, zelfs als ze hetzelfde aantal woorden moesten hebben.

Waarom is dit belangrijk?

Dit onderzoek heeft twee kanten, net als een muntje:

  • De goede kant (Voor wetenschappers): We kunnen nu betere simulaties maken. Als we willen weten hoe meningen in de maatschappij veranderen, of hoe we online haat kunnen bestrijden, kunnen we nu "virtuele mensen" gebruiken om dit te testen zonder echte mensen te schaden. Het is alsof we een proefballonnetje opsturen in een storm, in plaats van echte mensen de storm in te sturen.
  • De slechte kant (Het gevaar): Als robots zo goed kunnen praten als mensen, kunnen slechte actoren dit misbruiken. Ze kunnen duizenden nep-accounts laten praten om een valse mening te creëren (bijvoorbeeld: "Iedereen vindt dit product geweldig" terwijl het nep is). Dit heet een "AI-zwerm" en kan de democratie of de publieke opinie manipuleren.

Conclusie

Kortom: Robots zijn nu zo slim dat ze in een online discussie bijna net zo goed doen als echte mensen. Ze zijn nog niet perfect (ze zijn vaak te beleefd en te logisch), maar ze zijn al goed genoeg om ons voor de gek te houden.

De boodschap is: Wees kritisch. Als je online iets leest dat te perfect, te beleefd of te saai klinkt, is het misschien wel een robot. En voor de toekomst: we moeten oppassen dat we deze technologie niet gebruiken om de waarheid te vervalsen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →