On the missing benchmarks layer and a potential solution
Dit artikel identificeert het ontbreken van een regionale benchmarklaag als een kritieke barrière voor de inheemse AI-ontwikkeling in Latijns-Amerika en stelt "EvalsHub" voor (met de eerste instantie, LatamBoard) als een open, door prikkels gedreven infrastructuur om onafhankelijke auditing en optimalisatie van AI-systemen tegen lokale sociale en economische vereisten mogelijk te maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Onzichtbare Scorebord: Waarom AI een Lokale Test Nodig Heeft
Stel je de wereld van Kunstmatige Intelligentie voor als een enorme, hoogtechnologische keuken waar chefs (de AI-modellen) gerechten bereiden voor iedereen om te eten. Al een tijdje werken de meest beroemde chefs in slechts een paar specifieke keukens, gebruikmakend van recepten en ingrediënten uit hun eigen buurt. Ze zijn ongelooflijk talentvol, maar ze weten niet altijd hoe ze een gerecht moeten maken dat perfect smaakt voor een gezin dat in een ander deel van de wereld woont. Dit is de wereld van AI: krachtige instrumenten gebouwd op één plek, maar vaak overal gebruikt.
Om te weten of een chef echt goed is in het koken van een specifkel gerecht, heb je een proeverij nodig. In de wereld van AI wordt deze proeverij een benchmark genoemd. Denk aan een benchmark als een gestandaardiseerd examen of een scorebord. Het vraagt niet alleen: "Kan de AI praten?" Het vraagt: "Kan de AI dit specifieke probleem oplossen in deze specifieke taal met deze lokale regels?" Zonder deze lokale scoreborden zijn landen en bedrijven als gasten die een maaltijd eten zonder te weten of deze vers, veilig of zelfs wel bedoeld is om zo te smaken. Ze moeten alleen op het woord van de chef vertrouwen. Dit artikel betoogt dat Latijns-Amerika zijn eigen keuken-scorebord mist, en dat het zonder dit scorebord de regio niet echt kan controleren of de AI die het gebruikt wel correct werkt, of het kan verbeteren om de eigen unieke problemen op te lossen.
Het Ontbrekende Scorebord: Een Verhaal over de AI-kloof in Latijns-Amerika
De auteurs van dit artikel, een team van SURUS en een onafhankelijke onderzoeker, wijzen op een enorme gat in de kaart van de Latijns-Amerikaanse technologie. Ze noemen het de "ontbrekende benchmark-laag". Om te begrijpen waarom dit ertoe doet, stel je voor dat je een auto probeert te repareren, maar je hebt alleen gereedschap dat ontworpen is voor een ander merk auto. Je krijgt de klus misschien wel geklaard, maar het zal niet perfect zijn en je zult niet precies weten waar de motor hapert. Dat is wat Latijns-Amerika momenteel ervaart met AI.
De Twee Grote Problemen: Blinde Audits en Stilstaande Motoren
Het artikel legt uit dat deze ontbrekende laag twee grote hoofdpijndossiers veroorzaakt.
Ten eerste is er het Auditprobleem. Stel je een overheidsinstantie voor die een nieuw AI-systeem koopt om het beheer van publieke registers te ondersteunen. Omdat de AI in een ander land is gebouwd, heeft de instantie geen manier om onafhankelijk te controleren of het systeem de lokale wetgeving begrijpt of de lokale dialecten correct spreekt. Ze zijn gedwongen om simpelweg de claims van de verkoper te vertrouwen. De auteurs suggereren dat deze instellingen zonder een lokale benchmark "blind" zijn. Ze kunnen niet zien of de AI fouten maakt die alleen relevant zijn in hun specifieke context, zoals het verkeerd identificeren van een lokale ziekte bij gewassen of het verkeerd begrijpen van een specifieke juridische term.
Ten tweede is er het Optimalisatieprobleem. Dit is voor de bedrijven die proberen coole AI-tools te bouwen. Moderne AI-ontwikkeling is als een videogame waarbij je instellingen aanpast om een hogere score te halen. Maar om een hogere score te halen, heb je een scorebord nodig om je vooruitgang te meten. Het artikel betoogt dat bedrijven zonder een lokale benchmark geen doel hebben om naar te streven. Ze kunnen niet weten of hun AI beter wordt in het oplossen van lokale problemen omdat ze geen "examen" hebben om het tegen af te zetten. Het is als proberen een race te hardlopen zonder finishlijn; je rent misschien hard, maar je weet niet of je daadwerkelijk aan het winnen bent.
De Voorgestelde Oplossing: De EvalsHub en LatamBoard
Dus, wat is de oplossing? De auteurs stellen voor om een nieuwe infrastructuur te bouwen genaamd een EvalsHub, met de eerste versie genaamd LatamBoard.
Beschouw LatamBoard als een enorme, open-source "examenhal" voor de regio. Het is een plek waar universiteiten, overheden en bedrijven hun eigen tests (benchmarks) kunnen publiceren en kunnen zien hoe verschillende AI-modellen op deze tests presteren.
- Het is Taakgericht: In plaats van alleen te testen "hoe slim is de AI?", zijn de tests gebouwd rond specifieke taken. Een test kan bijvoorbeeld specifiek ontworpen zijn voor "het extraheren van medische informatie uit Chileense gezondheidsdossiers" of "het classificeren van plagen in Colombiaanse koffieplantages."
- Het is Herbruikbaar: Het artikel gebruikt een mooie zin: "Eenmaal gebouwd, voor altijd gemeten." Zodelijk een test is gemaakt, kan deze keer op de keer worden uitgevoerd. Elke keer wanneer een nieuw AI-model uitkomt, of een bedrijf zijn software aanpast, kunnen ze dezelfde test draaien om te zien of ze verbeterd zijn. Dit verandert de benchmark in een permanent stuk infrastructuur, zoals een weg of een brug, in plaats van een eenmalig project.
Het "Toegangsprobleem": Waarom het Moeilijk is om te Bouwen
Het artikel geeft ook toe dat het bouwen van deze scoreborden erg moeilijk is. Het gaat niet alleen om het schrijven van code. Om een geldige test te maken voor een specifieke taak (zoals het diagnosticeren van een ziekte), heb je vier verschillende soorten experts nodig die samenwerken:
- Een Domeinexpert (zoals een arts of advocaat) die weet hoe het "correcte" resultaat eruitziet.
- Een ML Engineer die die kennis kan omzetten in een computertest.
- Een Statisticus om ervoor te zorgen dat de testvragen eerlijk en representatief zijn.
- Een Developer om ervoor te zorgen dat de test soepel verloopt.
De auteurs noemen dit het "Toegangsprobleem". Meestal weet de persoon die het meeste van de baan weet (de arts) niet hoe hij de test moet coderen, en de programmeur kent de medische details niet. Deze mismatch betekent dat zeer weinig mensen deze benchmarks op hun eigen kracht kunnen bouwen. Het artikel suggereert dat voor LatamBoard een manier gevonden moet worden om de drempel te verlagen, zodat experts hun kennis kunnen bijdragen zonder dat zij een codeerwizard hoeven te zijn.
Een Visie voor de Toekomst: Open en Multipolair
De auteurs hebben een sterke visie op hoe dit moet werken. Ze willen een "multipolaire" wereld, wat betekent dat ze niet willen dat één of twee landen alle AI-regels controleren. Ze willen dat Latijns-Amerika zijn eigen stem en zijn eigen standaarden heeft.
Om dit te realiseren, stellen ze voor dat LatamBoard open door ontwerp moet zijn (iedereen kan de tests en resultaten inzien) en prikkelgestuurd door constructie (mensen krijgen erkenning en waardering voor hun hulp). Als een universiteit een geweldige test creëert voor de lokale landbouw, krijgen zij de eer om als bijdrager te worden genoemd, en profiteert de rest van die test. Het is een systeem waarin het delen van kennis iedereen slimmer en krachtiger maakt.
Wat is Nog Onbekend?
Het artikel is eerlijk over het feit dat dit een startpunt is, en geen afgewerkt product. Ze geven toe dat er nog steeds grote vragen zijn, zoals:
- Hoe zorgen we ervoor dat de tests eerlijk blijven naarmate AI slimmer wordt?
- Wie betaalt voor de computers die nodig zijn om deze tests uit te voeren?
- Hoe gaan we om met gevoelige gebieden zoals de gezondheidszorg, waar privacy van groot belang is?
De auteurs beweren niet dat ze al al deze problemen hebben opgelost. In plaats daarvan werpen ze een uitdaging toe aan de gemeenschap. Ze nodigen universiteiten, overheden en bedrijven uit om samen te komen en deze laag van infrastructuur te bouwen. Het doel is om een systeem te creëren waarin Latijns-Amerika niet alleen een consument van AI is, maar een vormgever ervan, met zijn eigen instrumenten om de technologie die het gebruikt te meten, te verbeteren en te vertrouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.