Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
Deze studie evalueert het vermogen van zeven Large Language Models om individuele domeinkennis af te leiden uit Slack-communicatielogboeken door hun zero-shot schattingen te vergelijken met zelfgerapporteerde vaardigheden, en komt tot de bevinding dat hoewel Gemini 2.5 Flash de hoogste nauwkeurigheid behaalde, de inferentieprestaties slechts zwak afhankelijk zijn van het berichtvolume en de noodzaak benadrukken voor privacy-bewarende en structuurbewuste benaderingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorm, druk kantoor binnenloopt. Je hebt een lastig probleem, maar je weet niet wie je moet vragen. Is het de persoon in de hoek die de hele dag over programmeren praat? Of degene die alles lijkt te weten over projectmanagement? Meestal moet je dan rondlopen, een paar mensen vragen en hopen dat je de juiste expert vindt. Dit "gokspel" kost tijd en geld.
Dit artikel stelt een simpele vraag: Kan een AI fungeren als een super-attent stagiair die ieders chatgeschiedenis leest en je direct vertelt wie wat weet?
Hieronder volgt een eenvoudige uitleg van hun experiment:
De Opzet: De "Chat-Detective"
De onderzoekers namen een enorme stapel echte chatberichten van het Slack-account van een bedrijf (ongeveer 27.000 berichten van 43 personen over een periode van meerdere jaren). Ze voerden deze berichten in bij zeven verschillende "superhersens" (Grote Taalmodellen zoals GPT, Claude en Gemini).
Stel je deze AI-modellen voor als verschillende soorten detectives:
- Sommigen zijn snel maar misschien wat oppervlakkig (zoals een snelle scanner).
- Sommigen zijn traag maar diepzinnig (zoals een professor die een boek analyseert).
- Sommigen zijn generalisten, terwijl anderen specialisten zijn.
De taak van de AI was om de chats te lezen en een "vaardigheidsrapport" voor elke persoon op te stellen. Als iemand bijvoorbeeld voortdurend over "Python" en "Data Science" praatte, zou de AI raden: "Deze persoon kent Python."
De Realiteitscheck: De "Zelfrapportage"
Om te zien of de AI zijn werk goed deed, vroegen de onderzoekers de echte mensen om zichzelf te beoordelen. Ze maakten een eenvoudige website waar elke persoon de lijst met vaardigheden die de AI had gevonden bekeek en zei: "Ja, ik ken dit," of "Nee, dat ken ik niet."
Vervolgens vergeleken de onderzoekers het gissen van de AI met het daadwerkelijke antwoord van de mens. Het is alsof een leraar het gokwerk van een leerling over de antwoorden op een toets beoordeelt aan de hand van het echte antwoordensleutel.
De Resultaten: Wie won de wedstrijd?
De onderzoekers testten zeven verschillende AI-modellen. Hier is hoe ze gerangschikt werden:
- De Winnaar: Gemini 2.5 Flash was de beste gokker. Hij zat ongeveer 21 punten naast op een schaal van 0–100. (Als de mens aangaf 80% expert te zijn, gokte de AI op ongeveer 59% of 101%).
- De Tweede: Gemini 2.5 Pro zat er dichtbij.
- Het Middenveld: De Claude-modellen (Haiku en Sonnet) waren oké, maar niet zo scherp als de Gemini-modellen.
- De Strijders: De GPT-modellen (inclusief de zeer beroemde GPT-4o en GPT-5) presteerden het slechtst. Zij zaten gemiddeld ongeveer 33 punten naast.
De Grote Conclusie: Zelfs de beste AI was niet perfect. Het kon wel een algemeen idee krijgen van wie wat weet, maar het kon het exacte niveau van expertise niet met hoge precisie bepalen.
De Verassende Draai: Meer Tekst ≠ Betere Gokken
Je zou denken: "Als ik de AI een miljoen berichten geef in plaats van duizend, wordt hij dan slimmer, toch?"
Niet noodzakelijkerwijs. De onderzoekers ontdekten dat simpelweg meer chatgeschiedenis hebben de gokken van de AI niet automatisch accurater maakte.
- Waarom? Omdat veel chatberichten gewoon "Oké", "Begrepen" of "Lunch om 1?" zijn. Deze vertellen je niet wat iemand weet.
- De Limiet: Zodra de AI een minimum hoeveelheid chat had om mee te werken, hielp het toevoegen van meer niet veel. Het is alsof je probeert iemands favoriete film te raden door hun boodschappenlijstje te lezen; hoe lang het lijstje ook is, het vertelt je niet veel over hun smaak in cinema.
De Conclusie
De studie bewijst dat AI kan gluren in onze chatlogs en een redelijke gok kan doen over onze vaardigheden. Het is een nuttig hulpmiddel om een ruwe kaart te krijgen van "wie wat weet" in een bedrijf.
Echter, het is nog geen magische kristallen bol. De AI maakt nog steeds fouten, en de beroemde GPT-modellen haalden in deze specifieke test niet eens de eerste plaats. De onderzoekers merkten ook op dat dit in het echt alleen werkt als bedrijven zeer voorzichtig zijn met privacy, omdat het sturen van privébedrijfschats naar externe AI-servers een gevoelig onderwerp is.
Kortom: AI wordt beter in het lezen van de sfeer, maar het moet nog leren het onderscheid te maken tussen iemands werkelijke expertise en gewoon hun dagelijkse gepraat.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.