BenCSSmark: Making the Social Sciences Count in LLM Research
Dit position paper betoogt dat de ondervertegenwoordiging van taakken uit de sociale wetenschappen in huidige LLM-benchmarks zowel de vooruitgang van AI als het sociaalwetenschappelijk onderzoek belemmert, en pleit voor de invoering van "BenCSSmark"—een nieuwe benchmark bestaande uit door computationele sociaalwetenschappers geannoteerde datasets—om robuustere, transparantere en maatschappelijk relevantere AI-systemen te creëren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van Kunstmatige Intelligentie (KI) voor als een enorme, hoog-risico sportliga. In deze liga zijn Grote Taalmodellen (LLM's) de atleten, en benchmarks zijn de gestandaardiseerde tests en scoreborden die worden gebruikt om te zien wie de beste is.
Op dit moment is deze liga bezeten van een zeer specifieke reeks onderdelen: wiskundeproblemen, programmeeruitdagingen en het vertalen van talen. De atleten trainen eindeloos voor deze specifieke drills, omdat dat hen op de ranglijst brengt en beroemd maakt.
Het Probleem: De Ontbrekende "Sociale Wetenschappen"-onderdelen
De auteurs van dit artikel betogen dat de liga een enorme, belangrijke categorie onderdelen mist: Sociale Wetenschappen.
Denk aan sociale wetenschappen (zoals sociologie, geschiedenis, politicologie en economie) als de studie van hoe mensen daadwerkelijk leven, ruziën en elkaar begrijpen. Deze vakgebieden staan vol met rommelige, complexe en genuanceerde gegevens.
- Het Probleem: Hoewel sociaalwetenschappers duizenden hoogwaardige, door experts geannoteerde datasets hebben gecreëerd (zoals een trainer die een gedetailleerd spelplan voorbereidt), zijn deze datasets onzichtbaar voor de KI-liga. Ze zijn verspreid over verschillende bibliotheken, niet gestandaardiseerd en zelden gebruikt om KI te testen.
- Het Gevolg: Omdat KI-modellen niet worden getest op deze "sociale" taken, zijn ze er verschrikkelijk slecht in. Ze zijn misschien geweldig in het oplossen van een wiskundige vergelijking, maar falen jammerlijk in het begrijpen van het verschil tussen een "kritische" politieke opmerking en een "haatdragende" één, of in het opsporen van subtiele culturele vooroordelen in een nieuwsartikel.
De Oplossing: BenCSSmark
Om dit op te lossen, hebben de auteurs BenCSSmark gecreëerd. Je kunt dit zien als een nieuw, gespecialiseerd trainingsveld en competitie die specifiek is ontworpen voor de "Sociale Wetenschappen"-onderdelen.
Hier is wat BenCSSmark speciaal maakt, met behulp van eenvoudige analogieën:
Het is een "Stresstest" voor KI:
Standaardtests vragen: "Kun jij dit oplossen?" BenCSSmark vraagt: "Kun jij de context begrijpen?"- Analogie: Een standaardtest zou kunnen vragen: "Is deze zin grammaticaal correct?" BenCSSmark vraagt: "Is deze zin politiek bevooroordeeld, en maakt het uit wie het zegt en wanneer?" Het dwingt de KI om te navigeren in ambiguïteit, culturele verschillen en tegenstrijdige standpunten – dingen die makkelijk zijn voor mensen maar moeilijk voor robots.
Het respecteert de "rommeligheid" van menselijke mening:
In veel KI-tests is er één enkel "correct" antwoord (Goudstandaard). Maar in de sociale wetenschappen zijn mensen het vaak oneens.- Analogie: Stel je een panel van juryleden voor. In een standaardtest moeten ze allemaal akkoord gaan met één score. In BenCSSmark registreert het systeem elke score van de juryleden. Als één expert denkt dat een tweet "kritisch" is en een ander denkt dat het "haatdragend" is, bewaart het systeem beide meningen. Dit leert de KI dat menselijke taal vaak subjectief is en dat er niet altijd één enkele "waarheid" is.
Het is een brug tussen twee werelden:
Het project brengt Computerwetenschappers (de KI-bouwers) en Sociaalwetenschappers (de menselijke experts) samen.- Analogie: Het is alsof je de coaches van het "Menselijk Gedrag"-team uitnodigt in de "Robottrainings"-faciliteit. De computerwetenschappers krijgen toegang tot rijke, real-world data waarvan ze niet wisten dat het bestond, en de sociaalwetenschappers krijgen KI-tools die hun specifieke onderzoeksvragen daadwerkelijk begrijpen.
Wat zit er in de doos?
Het artikel introduceert een verzameling van 27 verschillende "taken" (datasets) die momenteel in het Frans zijn. Dit zijn niet zomaar generieke teksten; ze zijn specifiek voor echte onderzoeksvragen, zoals:
- Detecteren of een politicus een "hervormingsbelofte" doet.
- Uitzoeken of een muziekrecensie "prescriptief" is (je vertellen wat je moet denken) of gewoon beschrijvend.
- Opsporen van "niet-toegeschreven citaten" in kranten.
- Identificeren van "geslacht" of "sociale klasse"-concepten in academische samenvattingen.
De Waarschuwing (De "Doe-niet's")
De auteurs waarschuwen zorgvuldig dat benchmarks gevaarlijk kunnen zijn als we niet oppassen.
- De Valstrik: Als we de benchmark te rigide maken, kunnen KI-modellen gewoon "cheaten" door de testantwoorden uit het hoofd te leren in plaats van daadwerkelijk te leren mensen te begrijpen.
- De Oplossing: De auteurs suggereren dat we de tests divers en voortdurend bijgewerkt moeten houden, zodat de KI niet gewoon het spelplan kan uit het hoofd leren. Ze geven ook toe dat de data momenteel voornamelijk in het Frans en tekstgebaseerd is, dus het is slechts de "eerste stap" van een veel groter project.
De Conclusie
Het artikel betoogt dat we, om echt slimme KI te bouwen, moeten stoppen met het negeren van de sociale wetenschappen. Door deze complexe, mensgerichte taken te integreren in de standaardtesten van KI, kunnen we modellen bouwen die niet alleen goed zijn in wiskunde en code, maar ook robuust, eerlijk en capabel zijn om de rommelige, prachtige complexiteit van de menselijke samenleving te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.