Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
Dit artikel toont aan dat het aggregeren van outputs van meerdere grote taalmodellen, zowel binnen als tussen verschillende architecturen, schattingsfouten significant vermindert en metacognitief bewustzijn van onzekerheid onthult, wat een schaalbaar alternatief biedt voor menselijke zwermintelligentie voor organisatorische besluitvorming.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Kan AI "Crowdsourcing" gebruiken voor slimmere antwoorden?
Stel je voor dat je probeert te raden hoe zwaar een enorme os is. Als je het aan één persoon vraagt, zit die er misschien flink naast. Maar als je 100 mensen vraagt en het gemiddelde neemt van hun gokken, is de uitslag vaak ongelooflijk nauwkeurig. Dit is de beroemde "Wisdom of the Crowd" (de wijsheid van de menigte).
Decennialang hebben mensen deze truc gebruikt. Maar het verzamelen van 100 mensen is traag, duur en moeilijk te organiseren.
Dit paper stelt een nieuwe vraag: Kunnen we een "Artificiële Menigte" creëren met behulp van Large Language Models (LLM's) zoals GPT-5, Gemini en Claude? In plaats van 100 mensen te vragen, kunnen we één AI 30 keer vragen, of drie verschillende AI's elk 10 keer, en krijgen we zo een beter antwoord dan wanneer we slechts één AI vragen?
Het Experiment: Het "Gokspelletje"
De onderzoekers zetten een gecontroleerd spel op om dit te testen. Ze vroegen de AI's geen simpele vragen zoals "Wie is de president?", omdat AI's die feiten gewoon uit het hoofd kennen. In plaats daarvan gaven ze ze 8 lastige schattingsproblemen die vragen om een gok en redenering, zoals:
- "Hoeveel zou het kosten om het hele metrostation van New York vanaf nul weer op te bouwen?"
- "Hoeveel gallons benzine verbruikt een auto gedurende zijn hele levensduur?"
- "Wat zal de aandelenprijs van een specifiek bedrijf volgend jaar zijn?"
Ze behandelden de AI's als een menigte mensen. Ze gebruikten drie hoofdstrategieën:
- De Solo-Artiest: Ze vroegen één specifieke AI (bijv. alleen GPT-5) dezelfde vraag 30 keer. Omdat AI enigszins willekeurig is (zoals een mens die een "slechte dag" of een "goede dag" heeft), gaf het 30 licht verschillende antwoorden.
- Het Panel van Experts: Ze vroegen drie verschillende AI's (GPT-5, Gemini en Claude) dezelfde vraag 10 keer per stuk.
- Het Grootste Gemiddelde: Ze namen al die antwoorden en berekenden het gemiddelde om te zien of de "menigte" slimmer was dan een individuele entiteit.
Wat ze vonden
1. De Menigte is Slimmer (Meestal)
Net als bij mensen was de "Artificiële Menigte" meestal nauwkeuriger dan de gok van een enkele AI.
- De Analogie: Stel je voor dat drie vrienden het aantal jellybeans in een pot proberen te raden. De een raadt 500, de ander 1.000 en de derde 2.000. Het gemiddelde is 1.166. Als het echte antwoord 1.100 is, dan ligt het gemiddelde veel dichterbij dan de gok van een enkele vriend.
- Het Resultaat: Door de antwoorden te middelen, daalden de fouten aanzienlijk. In sommige gevallen was de "menigte" tot wel 37% nauwkeuriger dan een enkele AI-gok.
2. Het "Echo Chamber"-probleem
Wanneer ze dezelfde AI 30 keer vroegen, hielp dat wel, maar niet zo goed als het vragen aan verschillende AI's.
- De Analogie: Als je dezelfde persoon 30 keer hetzelfde vraagt, kan het zijn dat diegene simpelweg 30 keer dezelfde fout maakt, of dat hun "slechte stemming" alle 30 gokken in dezelfde verkeerde richting beïnvloedt.
- Het Result resultaat: Het mengen van verschillende soorten AI's (het "Panel van Experts") werkte het best, omdat zij verschillende soorten fouten maakten, die elkaar vervolgens opheffen.
3. De "Confidence Meter" werkt
De onderzoekers vroegen de AI's niet alleen om een getal, maar ook om een "betrouwbaarheidsinterval" (een bereik waarin zij denken dat het antwoord ligt).
- De Analogie: Stel je een weerman voor die zegt: "Het gaat regenen, en ik ben voor 90% zeker dat het tussen 13:00 en 15:00 uur zal zijn."
- Het Resultaat: De AI's waren verrassend goed in weten wanneer ze het niet zeker wisten. Wanneer ze een breed bereik gaven (bijv. "Het kan ergens tussen de 10 en 100 zijn"), zaten ze meestal heel erg naast het doel. Wanneer ze een smal bereik gaven (bijv. "Het is definitief tussen de 40 en 42"), hadden ze meestal gelijk. Dit suggereert dat de AI een vorm van "zelfbewustzijn" heeft over de eigen onzekerheid.
4. Niet alle gokken zijn gelijk
De "menigte" werkte het best bij problemen met historische patronen, zoals aandelenkoersen of economische trends.
- De Analogie: Het is makkelijk om de gemiddelde temperatuur in juli te raden, omdat je gegevens hebt van de afgelopen 10 jaar. Het is zeer moeilijk om de kosten van een hypothetisch nieuw metrosysteem te raden dat nog nooit gebouwd is.
- Het Resultaat: De AI-menigte was goed in het voorspellen van trends, maar had moeite met volledig nieuwe, creatieve "wat als"-scenario's waarbij geen historische data beschikbaar was om op terug te vallen.
De Kernboodschap
Dit paper bewijst dat AI de "Wisdom of the Crowd" kan nabootsen. Door meerdere AI-modellen te vragen (of één model vele malen te vragen) en hun antwoorden te middelen, kun je aanzienlijk nauwkeurigere resultaten krijgen dan wanneer je op één enkele AI vertrouwt.
Het laat ook zien dat deze AI-modellen ons kunnen vertellen wanneer ze blind gokken (door brede betrouwbaarheidsintervallen te geven), wat een nuttig hulpmiddel is voor iedereen die beslissingen met AI probeert te nemen. Deze "super-menigte" werkt echter het beste wanneer er enige data of geschiedenis is om de gok te sturen, in plaats van pure verbeelding.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.