AI-rithmetic
Dit onderzoek analyseert waarom geavanceerde AI-modellen moeite hebben met eenvoudige rekenkunde en toont aan dat fouten bij het optellen van getallen hoofdzakelijk worden veroorzaakt door misalignement van operanden (vaak door tokenisatie) of het onjuist doorgeven van carries.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De "Geniale Wiskundige" die niet kan optellen: Wat is er mis met AI?
Stel je voor: je hebt een vriend die de meest complexe filosofische vragen kan beantwoorden, de nieuwste wetenschappelijke ontdekkingen kan verklaren en zelfs kan helpen bij het bewijzen van ingewikkelde wiskundige stellingen. Hij is een soort digitale Einstein. Maar zodra je hem vraagt: "Wat is 456 + 789?", begint hij te zweten, raakt hij in de war en geeft hij een antwoord dat nergens op slaat.
Dat klinkt absurd, maar dit is precies wat er aan de hand is met de slimste AI-modellen van dit moment (zoals ChatGPT en Claude). Dit onderzoek, getiteld "AI-rithmetic", legt uit waarom deze "superbreinen" eigenlijk een beetje dom zijn in de basis.
Het probleem: De glazen brug
De onderzoekers ontdekten dat hoe langer de getallen worden, hoe sneller de AI van de brug valt. Een AI kan misschien prima twee kleine getallen optellen, maar zodra je een getal van 20 of 50 cijfers geeft, stort de nauwkeurigheid volledig in. Het is alsof je een architect vraagt een wolkenkrabber te ontwerpen (moeilijk), maar hij vergeet de fundering van het huis te leggen (simpel).
Waarom gaat het mis? (De twee grote fouten)
De onderzoekers ontdekten dat de AI niet zomaar "fouten" maakt, maar dat ze bijna altijd in twee specifieke valkuilen trappen:
1. De "Versprongen Bladwijzer" (Misalignment)
Stel je voor dat je een rekensom maakt op een vel papier met kolommen. Je begint bij de eenheden, dan de tientallen, enzovoort. De AI maakt er vaak een fout van waarbij hij per ongeluk een kolom overslaat of een getal een plekje opschuift. Het is alsof je een tekst probeert over te schrijven, maar halverwege per ongeluk een regel overslaat.
- De oorzaak: Dit komt vaak door de manier waarop AI "leest" (tokenization). De AI ziet getallen niet als losse cijfers (1, 2, 3), maar vaak als groepjes (bijv. 123). Als die groepjes niet mooi aansluiten op de lengte van het getal, raakt de AI de weg kwijt in de kolommen.
2. De "Vergeten Overdracht" (Close Carry Errors)
Dit is de klassieke fout die je ook op de basisschool maakte: "9 + 5 is 14, dus schrijf een 4 op en vergeet de 1 niet door te geven aan de volgende kolom."
De AI doet dit constant fout. Soms vergeet hij die '1' door te geven, en soms geeft hij hem juist door terwijl dat niet hoefde. Het is alsof je een estafette loopt, maar de loper de stok laat vallen of hem aan de verkeerde persoon geeft. De onderzoekers ontdekten dat dit bijna als een soort "dobbelspel" werkt: bij elke kolom waar een overdracht nodig is, heeft de AI een kleine kans om de fout in te gaan. Hoe meer kolommen, hoe groter de kans dat de hele ketting breekt.
Wat betekent dit voor de toekomst?
De conclusie van het onderzoek is een beetje een waarschuwing. We denken vaak dat als we AI maar "groter" maken (meer rekenkracht, meer data), ze vanzelf alles leren. Maar dit onderzoek laat zien dat groter worden niet automatisch betekent dat de basis op orde komt.
Het is alsof je een professor in de filosofie traint om nog meer boeken te lezen; hij wordt wel wijzer, maar hij leert er niet automatisch van dat hij zijn veters moet strikken. Als we willen dat AI echt betrouwbaar wordt, moeten we niet alleen de "hersenen" groter maken, maar ook de fundamentele manier waarop ze met simpele regels en structuren omgaan, echt verbeteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.