Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems
Dit artikel introduceert Sci-Rho, een meertalige, visueel gegronde symbolische benchmark bestaande uit 4.242 uitvoerbare STEM-probleemtemplates over vijf vakgebieden en zeven talen, die aanzienlijke robuustheidskloven onthult in state-of-the-art Vision-Language Models wanneer deze worden geëvalueerd tegenover worst-case variaties in plaats van statische gemiddelden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je het vermogen van een nieuwe student om wetenschappelijke problemen op te lossen test. In het verleden gaven onderzoekers de student een enkel, statisch werkblad met één afbeelding en één vraag. Als de student het goed had, slaagde hij. Maar dit artikel betoogt dat dat is alsoals een bestuurder testen op slechts één lege, rechte weg. Het vertelt je niet of ze een plotselinge kuil, een omleiding of een andere weersomstandigheid kunnen afhandelen.
De auteurs van dit artikel, Sci-ρ, besloten een veel moeilijkere, meer dynamische rijtest te bouwen voor AI-"studenten" (specifiek Vision-Language Models of VLM's).
Hier is een eenvoudige uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden:
1. De "Vormveranderende" Test (De Dataset)
In plaats van de AI 606 statische wetenschappelijke vragen te geven, bouwden de onderzoekers een digitale fabriek.
- Het Blauwdruk: Ze creëerden 606 "templates" voor problemen in Wiskunde, Natuurkunde, Scheikunde, Biologie en Informatica. Denk aan deze als meesterblauwprints.
- De Fabriek: Ze schreven computercode (Python) die deze blauwdrukken neemt en onmiddellijk 10 licht verschillende versies van elk probleem uitprint.
- Voorbeeld: Als een wiskundeprobleem vraat naar de oppervlakte van een vierkant, print de fabriek één versie met een zijde van 5, een andere met 7, een andere met een andere kleur, of zelfs een andere vorm volledig.
- De Meertalige Twist: Ze deden dit niet alleen in het Engels. Ze vertaalden de instructies naar 7 talen (inclusief Swahili, Hindi en Arabisch), terwijl de afbeeldingen hetzelfde bleven.
- Het Resultaat: Ze kwamen uit op 42.420 unieke problemen. Het is alsof je de AI een enorme bibliotheek geeft waar elk boek 10 verschillende edities heeft, die allemaal dezelfde kernlogische vraag stellen maar er net iets anders uitzien.
2. De "Gemiddelde" vs. "Worst-Case" Valstrik
De onderzoekers testten 17 verschillende AI-modellen op deze enorme bibliotheek. Ze keken naar twee scores:
- Gemiddelde Nauwkeurigheid: Hoe vaak de AI het antwoord goed had over alle 10 de versies van een probleem.
- Worst-Case Nauwkeurigheid: Hoe vaak de AI elke enkele een van de 10 versies goed had.
De Grote Ontdekking:
De AI-modellen zagen er geweldig uit op de "Gemiddelde" score. Maar toen de onderzoekers naar de "Worst-Case" score keken, stortten de modellen in.
- De Analogie: Stel je een student voor die 9 van de 10 wiskundeproblemen goed heeft. Hij lijkt slim. Maar als je hem dezelfde 10 problemen opnieuw vraagt met licht verschillende getallen, en hij heeft deze keer 4 van hen fout, dan is hij niet echt aan het "redeneren" door de wangkunde. Hij is waarschijnlijk gewoon patronen aan het herkennen of aan het gokken op basis van hoe de getallen eruitzien.
- De Bevinding: Zelfs de slimste, duurste AI-modellen (zoals GPT-5.4) vertoonden een enorme kloof. Ze konden een probleem gemakkelijk oplossen, maar als ze de kleur van een grafiek of de getallen licht veranderden, faalden ze vaak. Kleinere, goedkopere modellen faalden nog harder.
3. De Taalbarrière
De onderzoekers controleerden of de AI meer moeite had wanneer de instructies in een andere taal dan het Engels waren.
- De Grote Modellen: De gigantische, dure modellen waren als polyglotten; ze gingen bijna even goed om met Engels, Chinees en Swahili.
- De Kleine Modellen: De kleinere, open-source modellen waren als toeristen die alleen Engels spreken. Wanneer de instructies overgingen naar een minder algemene taal (zo zoals Swahili), daalde hun prestatie aanzienlijk. Ze leken verward door de taalverandering, ook al was het wetenschappelijke probleem hetzelfde.
4. Het "Ogen vs. Brein" Probleem
De onderzoekers keken in één van de AI-modellen om te zien hoe het "dacht". Ze maten hoeveel aandacht het model besteedde aan de afbeelding versus de tekst.
- De Bevinding: De aandacht van het model verschoof afhankelijk van de taal.
- Wanneer de tekst in het Chinees was, vertrouwde het model minder op de afbeelding en meer op de tekst.
- Wanneer de tekst in het Kazachs of Hindi was, vertrouwde het model zwaar op de afbeelding.
- De Metafoor: Het is alsof de AI denkt: "Ik begrijp deze taal niet goed, dus ik gok maar op basis van de tekening." Wanneer het de taal perfect begrijpt, vertrouwt het de woorden meer. Dit suggereft dat de AI de afbeelding niet echt op een menselijke manier "ziet"; het gebruikt de afbeelding slechts als kruk wanneer de tekst verwarrend is.
5. Waar de AI Vastliep
Wanneer de AI faalde, categoriseerden de onderzoekers de fouten:
- De Afbeelding Verkeerd Lezen (63%): De AI kon de stippen in een diagram niet goed tellen of de getallen op een grafiek niet correct aflezen.
- Slechte Logica (29%): De AI kende de juiste formule maar paste deze toe op het verkeerde ding, of verzon feiten die er niet waren.
- Rekenfouten (8%): De AI had de logica goed, maar maakte fouten in de eenvoudige rekenkunde.
De Kernboodschap
Het artikel concludeert dat statische tests ons voorliegen. Alleen omdat een AI een specifieke wetenschappelijke vraag één keer kan oplossen, betekent niet dat hij de wetenschap begrijpt. Hij is mogelijk alleen patronen aan het herkennen die hij tijdens zijn training heeft gezien.
Om echt te weten of een AI slim is, moeten we de tafel schudden, de getallen veranderen, de talen wisselen en kijken of hij nog steeds het probleem kan oplossen. Als dat niet zo is, is het geen redeneren; het is gewoon gokken. Sci-ρ is het instrument dat ontworpen is om die tafel te schudden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.