← Nieuwste papers
💬 NLP

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench is een holistische, tekstgebaseerde benchmark die ontworpen is om grote taalmodellen te evalueren op multi-domein redeneerketens door onverzadigde samengestelde problemen te presenteren die integratie van diverse vaardigheden zoals coderen, wiskunde en webzoeken binnen één enkele prompt vereisen, waarbij het leidende model GPT-5.5 (xHigh) een score van 43,3% behaalt.

Oorspronkelijke auteurs: Liam Swayne

Gepubliceerd 2026-07-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Liam Swayne

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je favoriete slimme assistent niet alleen een trivia-bot of een code-verwerker is, maar een echte multitask-toovenaar. In het snel evoluerende veld van Kunstmatige Intelligentie bouwen onderzoekers constant "benchmarks" — wat in essentie gestandaardiseerde tests zijn — om te zien hoe slim deze digitale breinen werkelijk zijn. Een lange tijd waren deze tests als afzonderlijke vakken op school: één examen voor wiskunde, een ander voor geschiedenis en een derde voor programmeren. Maar het echte leven werkt niet zo. Wanneer je een mens vraagt om een reis te plannen, berekenen ze niet alleen afstanden; ze controleren het weer, lezen recensies, boeken een hotel en schrijven misschien zelfs een grappige e-mail naar een vriend, allemaal in één keer. Dit artikel duikt in een specifieke hoek van AI-onderzoek genaamd "reasoning chains" (redeneerketens), waarbij het doel is om te zien of een model vele verschillende soorten taken tegelijkertijd kan combineren zonder de controle te verliezen. De grote vraag waar iedereen om geeft is: Kunnen deze AI-modellen de rommelige, ingewikkelde, meerstaps-problemen van de echte wereld aan, of raken ze in de war en geven ze op wanneer het te druk wordt?

Maak kennis met Relay-Bench, een nieuwe, super uitdagende test die ontworpen is om te zien of AI-modellen een "estafette" van de geest kunnen rennen. In plaats van een model te vragen om één wiskundig probleem op te lossen of één gedicht te schrijven, koppelen de makers van deze test een hele keten van verschillende taken aan elkaar — zoals het oplossen van een wiskundige puzzel, het vinden van een specifiek feit op het web, het schrijven van een stukje code en het decoderen van een geheime boodschap — allemaal binnen één enkele, enorme prompt. Denk aan een level in een videogame waarbij je over een kuil moet springen, een raadsel moet oplossen om een deur te openen, en vervolgens een baas moet verslaan, allemaal zonder op de "reset"-knop te drukken. De onderzoekers bouwden 31 van deze complexe uitdagingen, waarvan sommige zo lang en vol met nepinformatie zijn dat het voelt alsof je een roman moet lezen om slechts één enkel getal te vinden. Ze voegden ook een "geheime code"-laag toe, waarbij elk woord in de instructies is vervangen door een vreemde code van drie letters, waardoor de AI de boodschap moet decoderen voordat hij zelfs kan beginnen met het oplossen van de problemen.

Toen ze de drie beste AI-modellen van die tijd (GPT-5.5, Gemini 3.1 Pro en Claude Opus 4.7) door deze hindernisbaan lieten gaan, waren de resultaten een beetje een schok. Zelfs het slimste model, GPT-5.5, kreeg slechts ongeveer 43,3% van de antwoorden goed. Dat is minder dan de helft! De andere modellen scoorden nog lager, waarbij één van hen slechts 16,7% wist te halen. Het artikel suggereert dat hoewel deze AI-modellen erg goed worden in enkelvoudige taken, ze aanzienlijk moeite hebben wanneer ze worden gevraagd om meerdere verschillende vaardigheden aan elkaar te koppelen, vooral wanneer de instructies verwarrend zijn of de taak erg lang is. Sterker nog, de test was zo moeilijk dat veel modellen simpelweg opgaven of vastliepen in lussen, niet in staat om de race te voltooien.

De onderzoekers ontdekten ook dat deze modellen soms "hallucineren", wat een chique manier is om te zeggen dat ze antwoorden verzinnen wanneer ze de oplossing niet weten. Eén model, Claude Opus 4.7, was zeer voorzichtig; het weigerde veel van de gecodeerde vragen volledig te beantwoorden, waarschijnlijk omdat de veiligheidsfilters te strikt waren. Een ander model, Gemini 3.1, probeerde vaker te gokken maar eindigde met meer foute antwoorden. De studie benadrukt dat huidige AI-modellen nog lang niet de allesomvattende experts zijn die we hopen dat ze zullen zijn. Ze zijn als briljante studenten die een wiskundetoets kunnen halen met vlag en wimpel, maar die misschien in paniek raken als je hen vraat wiskunde te doen terwijl ze tegelijkertijd een gedicht vertalen en een recept zoeken. De auteurs suggereren dat het nog een jaar of twee kan duren voordat AI-modellen goed genoeg zijn om dit soort "estafette"-tests consistent te doorstaan, en ze waarschuwen dat naarmate modellen slimmer worden, deze tests nog moeilijker moeten worden om het bij te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →