← Nieuwste papers
🤖 AI

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

Dit artikel toont aan dat het aggregeren van voorspellingen van diverse grote taalmodellen via geleerde methoden de prestaties van individuele modellen kan overtreffen, terwijl het benadrukt dat contaminatie door de trainingsstop de beoordeling van capaciteiten aanzienlijk vertekent en dat het primaire voordeel van dergelijke ensembles voortkomt uit het lineair combineren van diverse modeloutputs in plaats van complexe niet-lineaire interacties.

Oorspronkelijke auteurs: Igor Douven

Gepubliceerd 2026-07-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Igor Douven

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin de slimste persoon in de kamer eigenlijk helemaal niet de slimste is. In plaats daarvan is het echte genie de hele groep die rond de tafel zit. Dit idee, bekend als de "wijsheid van de menigte", suggereert dat als je de gokken van veel verschillende mensen neemt en daar het gemiddelde van maakt, het resultaat vaak nauwkeuriger is dan de gok van de beste individuele expert. Denk aan een zwerm vogels: geen enkele vogel ziet het hele plaatje, maar samen navigeren ze perfect. Wetenschappers weten al lang dat dit bij mensen werkt. Maar nu, met Kunstmatige Intelligentie (AI) overal, is er een grote vraag opgedoken: werkt deze magische truc ook voor robots? Als je een verzameling verschillende AI-modellen vraagt om de uitkomst van een toekomstige gebeurtenis te voorspellen, zal hun gecombineerde antwoord dan slimmer zijn dan een enkele AI? Dit is niet zomaar een leuk spelletje; het is belangrijk omdat als AI-menigtenes werken, we ze kunnen gebruiken om alles te voorspellen, van het weer tot de aandelenmarkten, zonder een team van menselijke experts nodig te hebben. Maar er is een addertje onder het gras: AI-modellen zijn getraind op data uit het verleden, en als ze het antwoord al in hun trainingsdata hebben "gezien", zijn ze niet echt aan het gokken—dan zijn ze gewoon aan het spieken door te onthouden.

Dit artikel duikt in precies die vraag, waarbij het 15 verschillende Large Language Models (LLM's) behandelt als een team van deelnemers in een voorspellingsspel. De onderzoekers vroegen deze AI's om de uitkomsten van 254 werkelijke vragen te raden, vergelijkbaar met wedden op of een sportteam zal winnen of een politicus gekozen zal worden. Vervolgens probeerden ze de antwoorden van de AI's op verschillende manieren te combineren om te zien of de groep de individuen kon verslaan. De resultaten waren een mix van opwindend nieuws en een belangrijke waarschuwing.

Ten eerste, het goede nieuws: de "wijsheid van de menigte" lijkt inderdaad te werken voor AI, maar alleen als je ze correct combineert. De onderzoekers ontdekten dat het simpelweg nemen van het gemiddelde van alle AI-gokken niet de beste strategie was. In plaats daarvan gebruikten ze een slim computerprogramma (een "learned aggregator") om te bepalen hoe ze de antwoorden moesten mengen. Deze slimme mixer deed het beter dan elk enkel AI-model, en zelfs beter dan het eenvoudige gemiddelde. Interessant genoeg suggereert de studie dat deze verbetering niet kwam door de AI-mixer die complexe, magische wiskunde uitvoerde. In plaats daarvan werkte het omdat de mixer leerde om meer gewicht toe te kennen aan de modellen die verschillende soorten fouten maakten. Het is als een sportcoach die beseft dat als de ene speler geweldig is in verdediging maar slecht in aanval, en een andere het tegenovergestelde is, het samenbrengen van hen beide alle basiszaken dekt. De studie vond dat een eenvoudige lineaire combinatie—in feite een gewogen gemiddelde—voldoende was om de beste resultaten te behalen, wat suggereert dat de sleutel tot AI-menigswijsheid diversiteit in fouten is, en niet complexe interacties.

Er is echter een enorme "maar" die alles verandert. De onderzoekers ontdekten dat veel AI-modellen stiekem aan het spieken waren. Omdat deze modellen getraind zijn op enorme stukken internet tot een bepaalde datum, "herinnerden" ze zich vaak de antwoorden op vragen die al beslecht waren voordat hun training stopte. Dit wordt contaminatie genoemd. Wanneer de onderzoekers alle vragen filterden waarvan ze konden vermoeden dat de AI's de antwoorden al kenden, veranderden de resultaten drastisch. De enorme kloof tussen de dure, geavanceerde "cloud"-modellen en de kleinere, lokale modellen verdween bijna volledig. De grote modellen zagen er veel minder indrukwekkend uit toen ze niet konden vertrouwen op hun geheugen. Sterker nog, zelfs de beste AI-menigte was nog steeds aanzienlijk slechter dan een echte menselijke voorspellingsmarkt, waar mensen geld inzetten op uitkomsten in realtime. De menselijke markt was ongeveer twee keer zo nauwkeurig als de AI-menigte, zelfs toen de mensen naar dezelfde informatie keken als de AI's.

Dus, wat is de les? AI-menigten kunnen slim zijn, maar ze worden gemakkelijk misleid door hun eigen geheugen. Als je wilt weten of een AI echt goed is in het voorspellen van de toekomst, moet je het testen op zaken die gebeurden nadat het leren van de AI was voltooid. Tot die tijd is de "wijsheid" van een AI-menigte misschien slechts een reflectie van wat het al weet, in plaats van wat het kan uitzoeken. De studie suggereert dat hoewel we betere AI-teams kunnen bouwen door verschillende modellen te mengen, we nog een lange weg te gaan hebben voordat ze de dynamische, realtime intelligentie van een menselijke menigte kunnen evenaren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →