From Checklists to Clusters: A Homeostatic Account of AGI Evaluation
Dit artikel betoogt dat AGI niet geëvalueerd moet worden als een statische som van symmetrische domeinscores, maar als een homeostatische eigenschapcluster, waarbij nieuwe metrieken worden voorgesteld die domeinen wegen op basis van causale centraliteit en de persistentie van capaciteiten onder stress meten om duurzame intelligentie te onderscheiden van broze prestaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te begrijpen wat iemand "slim" maakt. Al een lange tijd proberen wetenschappers dit te meten door mensen een enorme lijst met verschillende taken te geven—het oplossen van wiskundige puzzels, het onthouden van verhalen, het herkennen van patronen in vormen en het begrijpen van taal. Ze noemen dit "domeinen". Het idee is dat als je goed presteert op al deze punten, je een hoge intelligentie hebt. Maar er is een addertje onder het gras: wanneer we deze tests afnemen, behandelen we elke taak meestal alsof deze even belangrijk is. Het is alsof je een student beoordeelt door evenveel gewicht toe te kennen aan hun vermogen om hun veters te strikken als aan hun vermogen om een gedicht te schrijven. Bovendien zijn deze tests meestal "momentopnames". Je doet de test één keer, krijgt een score, en dat is het. Je weet niet of de student volgende week nog steeds in staat zal zijn om de puzzel op te lossen, of dat de prestaties zullen instorten als je de test iets moeilijker maakt of een paar dagen wacht voordat ze het opnieuw proberen.
Dit is de wereld van de evaluatie van Artificial General Intelligence (AGI). AGI is de droom om een computer te bouwen die even slim en flexibel is als een mens, in staat om te leren en problemen op te lossen in elke situatie, niet alleen in de situatie waarvoor hij geprogrammeerd is. Op dit moment testen onderzoekers deze AI-systemen met diezelfde "momentopname"-lijstjes. Maar als we willen weten of een AI werkelijk "algemeen" intelligent is, moeten we weten of zijn slimheid echt en blijvend is, of slechts een gelukkige truc die uit elkaar valt wanneer de omstandigheden stressvol worden. Dit artikel stelt een grote vraag: Hoe stoppen we met alleen maar punten tellen en beginnen we de stabiliteit van een machinegeest te meten?
De auteurs van dit artikel suggereren dat de manier waarop we AI momenteel testen, een beetje lijkt op het beoordelen van een auto enkel door te kijken hoe snel hij in een rechte lijn kan rijden op een zonnige dag. Hij lijkt misschien snel, maar dat vertelt ons niet of de motor standhoudt op een hobbelige weg of dat de remmen werken als het regent. Ze stellen dat echte intelligentie—of het nu bij mensen of machines is—niet alleen een lijst met vaardigheden is. In plaats daarvan is het meer als een homeostatische eigenschapcluster. Dat is een chique manier om te zeggen dat het een groep vermogens is die bij elkaar blijven omdat er interne mechanismen zijn die ze met elkaar verbinden, zelfs wanneer de zaken chaotisch worden of veranderen.
Denk aan intelligentie als een goed gebouwd kampvuur. De "domeinen" (wiskunde, taal, logica) zijn de blokken hout. Maar het vuur zelf is de hitte en de vlam die alle blokken samen laten branden. Als je alleen de blokken stapelt (de vaardigheden) maar niet het mechanisme hebt om het vuur brandend te houden (het homeostatische deel), dan zal een kleine windvlaag (een stressfactor of een vertraging) het vuur uitblazen. Het artikel suggereert dat huidige tests alleen controleren of de blokken aanwezig zijn, maar negeren of het vuur een windvlaag kan overleven.
De auteurs stellen twee belangrijke veranderingen voor om dit te repareren. Ten eerste zeggen ze dat we niet elke testvraag als even belangrijk moeten beschouwen. Net zoals sommige blokken dichter zijn en heter branden, zijn sommige vaardigheden meer "centraal" voor het in stand houden van het hele vuur. Ze stellen een nieuwe scoringsmethits voor genaamd een centrality-prior score. Dit zou de tests wegen op basis van hoeveel een specifieke vaardigheid helpt om het hele systeem stabiel te houden, waarbij ze ideeën lenen uit de manier waarop de menselijke intelligentie al wordt bestudeerd. Het is alsof je een student zwaarder beoordeelt op hun vermogen om nieuwe dingen te leren dan op hun vermogen om één enkel feit te onthouden.
Ten tweede willen ze stoppen met het vertrouwen op eenmalige momentopnames. In plaats daarvan stellen ze een Cluster Stabiliteitsindex voor. Dit gaat niet alleen over het eenmalig behalen van een hoge score; het gaat erom te bewijzen dat de AI die score kan behouden over de tijd en onder druk. Ze stellen voor om de AI op drie specifieke manieren te testen:
- Profielpersistentie: Herinnert de AI zich hoe hij dingen moet doen na dagen of weken?
- Duurzaam Leren: Als je het iets nieuws leert, blijft het dan hangen, of vergeet het het onmiddellijk?
- Foutcorrectie: Als de AI een fout maakt, kan hij deze dan zelf herstellen zonder vast te lopen?
Het artikel beweert niet dat het al een perfecte test heeft ontwikkeld of dat we het probleem van het meten van AGI al hebben opgelost. In plaats daarvan suggereren de auteurs dat deze nieuwe methoden beter zouden zijn. Ze bieden een blauwdruk aan voor laboratoria om deze ideeën uit te proberen. Ze stellen voor dat deze tests kunnen worden uitgevoerd, zelfs als de laboratoria niet precies weten hoe de AI van binnen is gebouwd (een "black-box"-benadering). Ze doen ook enkele voorspellingen over wat er zou gebeuren als we deze nieuwe tests zouden gebruiken, waarbij ze suggereren dat veel huidige AI-systemen er heel anders uit zouden zien—misschien minder "algemeen" intelligent en meer broos—zodra we beginnen te controleren op stabiliteit en weerstand tegen stress.
Kortom, het artikel betoogt dat we moeten overstappen van het afvinken van vakjes naar het controleren of het vuur blijft branden. Door de belangrijke vaardigheden zwaarder te laten wegen en te testen of de AI om kan gaan met vertragingen en fouten, kunnen we eindelijk een duidelijker beeld krijgen van of een machine werkelijk slim is of dat hij het alleen maar voor doet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.