COMPOSITE-Stem
Dit paper introduceert COMPOSITE-STEM, een nieuw open-source benchmark met 70 door experts geschreven taken in STEM-vakken, die aantoont dat de huidige state-of-the-art AI-agenten nog aanzienlijke beperkingen hebben bij het uitvoeren van complexe wetenschappelijke ontdekkingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep slimme robots (AI-agenten) wilt testen om te zien of ze echt kunnen helpen bij het oplossen van moeilijke wetenschappelijke problemen, zoals het ontwerpen van een nieuwe medicijn of het begrijpen van de ruimte.
Vroeger werden deze robots getest met simpele meerkeuzevragen, net als een schooltoets. Maar dat werkt niet meer goed. De robots zijn zo slim geworden dat ze die vragen uit hun hoofd kennen of ze makkelijk kunnen opzoeken. Het is alsof je een kind test op zijn rekenvaardigheid door alleen sommen te geven die hij al in zijn boekje heeft staan.
COMPOSITE-STEM is een nieuwe, veel zwaardere test die door een team van experts is bedacht. Hier is hoe het werkt, vertaald naar alledaags taal:
1. De Test: Een "Wetenschaps-Olympiade"
In plaats van meerkeuzevragen, krijgen de robots 70 echte, moeilijke taken uit vier vakken: Fysica, Biologie, Chemie en Wiskunde.
- Het idee: Het is alsof je een robot vraagt: "Ontwerp een nieuwe chemische stof die een ziekte geneest" of "Los dit complexe natuurkundige probleem op met een computerprogramma."
- De omgeving: De robots werken in een digitale werkplaats (een 'sandbox'). Ze moeten zelf software installeren, bestanden openen (zoals foto's van microscopen) en code schrijven om het antwoord te vinden. Ze kunnen niet zomaar een antwoord raden; ze moeten het bouwen.
2. De Scheidsrechters: Een "Jurie van Slimme Robots"
Hoe weet je of het antwoord goed is? Soms is er maar één goed antwoord (exact match), maar vaak is er ruimte voor verschillende manieren om een probleem op te lossen.
- De oplossing: De makers gebruiken een jury van andere AI's (5 verschillende modellen) om de antwoorden te beoordelen.
- De analogie: Stel je een talentenjacht voor. In plaats van dat één jurylid zegt "ja" of "nee", kijken 5 experts naar het optreden. Als 3 van de 5 zeggen dat het goed is, dan is het een pass. Ze gebruiken een strakke "scorekaart" (rubriek) om te kijken of de robot de juiste stappen heeft gezet, niet alleen of het eindantwoord klopt.
3. De Resultaten: De Robots Struikelen
De test is zo moeilijk dat zelfs de slimste robots van vandaag de dag er slecht in scoren.
- De winnaar: De beste robot (Claude Opus 4.6) haalde maar 21,4%. Dat klinkt laag, maar in deze test is het al een enorme prestatie. Het betekent dat ze 79% van de tijd vastlopen of de verkeerde oplossing kiezen.
- Waarom falen ze?
- Te snel opgeven: Sommige robots geven te snel op en schrijven een antwoord zonder het echt te hebben berekend.
- Verkeerde hulpmiddelen: Ze proberen een probleem op te lossen met de verkeerde tools (zoals proberen een auto te repareren met een hamer in plaats van een sleutel).
- Geen doorzettingsvermogen: De robots die wel iets bereiken, zijn vaak degene die blijven proberen, nieuwe software installeren en verschillende wegen verkennen. De robots die faalden, gaven vaak na een paar stappen op.
4. Waarom is dit belangrijk?
Deze test is als een realistische proefperiode voor robots voordat we ze echt in laboratoria of ziekenhuizen zetten.
- Als een robot deze test niet haalt, betekent het dat we ze nog niet kunnen vertrouwen met echt belangrijk werk.
- De makers hebben de test gratis openbaar gemaakt (zoals een open recept), zodat iedereen de robots kan blijven testen en verbeteren.
Kortom: COMPOSITE-STEM is een strenge, eerlijke en moeilijke test die laat zien dat robots nog veel moeten leren voordat ze echte wetenschappers kunnen vervangen. Het is een stap in de richting van AI die niet alleen antwoorden kan geven, maar ook echt werk kan doen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.