Benchmarking AI Performance on End-to-End Data Science Projects
Deze studie introduceert een nieuwe benchmark voor het beoordelen van het vermogen van AI-modellen om volledige data science-projecten tot stand te brengen, en concludeert dat hoewel recente modellen routine taken goed uitvoeren, ze bij oordeelsvorming nog aanzienlijke variatie vertonen en menselijke verificatie vereisen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🤖 De Grote AI-Cursus: Kunnen Robots Data-wetenschap doen?
Stel je voor dat data-wetenschap niet zomaar het schrijven van code is, maar meer lijkt op het bouwen van een compleet huis. Je moet niet alleen de bakstenen leggen (de code), maar ook het ontwerp maken, de fundering controleren, de muren schilderen, een handleiding schrijven en aan de buren uitleggen waarom dit huis veilig is.
Dit onderzoek, gedaan door Evelyn Hughes en Rohan Alexander, vroeg zich af: Kunnen AI-robots (zoals ChatGPT of Claude) dit hele huis in één keer bouwen, of blijven ze steken bij het leggen van de eerste baksteen?
1. De Proef: Een "Masterclass" voor Robots
De onderzoekers hebben een speciale test ontwikkeld, een soort grote eindopdracht voor universiteitsstudenten.
- De taak: De AI moest een volledig data-project maken. Dit betekende: een vraag bedenken, data downloaden, de data schoonmaken, grafieken maken, en een wetenschappelijk artikel schrijven.
- De jury: Normaal gesproken worden studenten beoordeeld door mensen. Maar omdat ze 350 projecten wilden controleren (7 robots x 5 projecten elk), hebben ze een digitale jurer (een andere AI) ingeschakeld om de werkstukken te nakijken.
- De cijfers: Een goed werk moet een 80% halen (een A- of B+). Alles eronder is onvoldoende.
2. De Uitslag: Niet alle robots zijn even slim
De resultaten waren verrassend. Het was alsof je een klas met verschillende leerlingen had:
- De Topper (Claude Opus 4.6): Deze AI haalde 85%. Hij zou net zo goed zijn als een gemiddelde, harde werkende student in zijn laatste jaar. Hij bouwde een stevig huis.
- De Sterke Tweede (GPT-5.2): Haalde 82%. Ook heel goed, bijna net zo goed als de top.
- De Middelmatige (Gemini 3 Flash): Haalde 78%. Net onder de streep van "uitstekend", maar nog steeds goed.
- De Verouderde (GPT-4o): Haalde slechts 32%. Dit is alsof een oude robot probeert een modern huis te bouwen en halverwege de fundering instort. Hij kon de complexe taken niet aan.
3. Waar waren ze goed in? (En waar faalden ze?)
De robots waren uitstekend in het volgen van instructies, maar slecht in het denken.
- Het "Recept" (Goed): Als je zegt: "Schrijf een titel" of "Maak een lijst met bestanden", deden de slimste robots dit perfect. Het was als het volgen van een kookrecept: ingrediënten mixen en in de oven doen.
- Het "Chef-koken" (Slecht): Als ze moesten beslissen waarom ze een bepaalde data-punt gebruikten, of hoe ze een complex verhaal moesten vertellen in een samenvatting, faalden ze vaak.
- Vergelijking: Een robot kan perfect een taart bakken als je hem exacte grammaten geeft. Maar als je vraagt: "Maak een taart die past bij dit specifieke feestje en leg uit waarom je deze smaak koos?", dan wordt het rommelig. Ze gebruiken vaak woorden die klinken als "belangrijk" of "inzicht", maar zeggen eigenlijk niets.
4. De Grootste Valkuil: Hallucinaties en Citaten
Een groot probleem was het verwijzen naar bronnen.
- De robots maakten vaak nep-citaties. Ze schreven bijvoorbeeld: "Matplotlib (2023?)" met een vraagteken. Het was alsof ze een boek verzonnen dat niet bestaat, maar dan met een vraagteken erachter.
- Ze hadden moeite om uit te leggen hoe een echt wereldprobleem (zoals dakloosheid) wordt omgezet in een rijtje cijfers in een spreadsheet. Dit vereist menselijk inzicht, iets wat AI nog niet echt heeft.
5. De Conclusie: AI is een stagiair, geen meester
De boodschap van dit onderzoek is duidelijk:
- AI is geweldig voor routine: Het kan de saaie, repetitieve taken doen (data downloaden, basiscode schrijven, bestandsnamen controleren).
- Maar je hebt een mens nodig: Je kunt AI niet zomaar loslaten op een project. Je moet het werk controleren, net als een meester-bouwer die kijkt of de stagiair de muren recht heeft gezet.
- De toekomst: De nieuwste robots (zoals Claude Opus 4.6) zijn zo goed dat ze bijna een volwaardige junior-data-analist kunnen vervangen voor de dagelijkse taken. Maar voor de moeilijke oordeelsvragen en het vertellen van het verhaal, blijft de mens onmisbaar.
Kortom: AI kan een heel mooi huis bouwen als je het precies vertelt hoe, maar het weet nog niet precies waarom het huis daar staat of hoe het eruit moet zien om de bewoners echt gelukkig te maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.