← Nieuwste papers
💬 NLP

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

Dit artikel introduceert TCS-Bench, een nieuwe benchmark die is ontworpen om de stellingbewijskundige capaciteiten op onderzoeksniveau van Large Language Models te evalueren met behulp van problemen uit vooraanstaande theoretische informatica-conferenties, vergezeld van een hoogwaardige verificatie-agent om gegenereerde bewijzen te valideren tegenover oordelen van menselijke experts.

Oorspronkelijke auteurs: Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson
Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen schaken spelen of gedichten schrijven, maar mensen ook daadwerkelijk helpen om nieuwe waarheden te ontdekken over hoe het universum werkt. Dit is het domein van de Theoretische Informatica (TCS), een vakgebied waar wiskundigen en informatici complexe logische structuren bouwen om te bewijzen dat bepaalde algoritmen werken, of dat specifieke problemen nooit opgelost kunnen worden. Denk aan het bouenen van een wolkenkrabber: je kunt niet zomaar de bovenste verdieping neerzetten; je hebt een solide fundament van definities nodig, een raamwerk van lemma's (kleine, bewezen feiten), en een duidelijk pad dat elke balk met de volgende verbindt.

Lama tijd hebben we slimme computerprogramma's, zogenaamde Large Language Models (LLM's), getest op wiskundige problemen die lijken op puzzels met hoge inzet. Dit zijn de "Sudoku's" of "Wiskundige Olympiade"-vragen van de AI-wereld: op zichzelf staand, met alle regels direct op de pagina vermeld. Maar echt wetenschappelijk onderzoek is geen puzzel; het is meer als het verkennen van een dicht, eeuwenoud bos. Je moet de lokale taal kennen, begrijpen hoe het ene pad naar het andere leidt, en onthouden aan welke bomen je al hebt geklommen. Tot nu toe hadden we geen goede manier om te testen of AI door dit rommelige, onderling verbonden bos van echt onderzoek kan navigeren. Dat is de kloof die dit artikel probeet te dichten.

Maak kennis met TCS-Bench, een nieuwe "hindernisbaan" ontworpen om te zien of AI daadwerkelijk wiskunde op onderzoeksniveau kan uitvoeren. De auteurs, een team van onderzoekers van Google en topuniversiteiten, creëerden een uitdaging waarbij een AI een doelstelling (een grote bewering om te bewijzen) en een "rugzak" aan context (definities en eerdere kleine bewijzen uit een echt wetenschappelijk artikel) krijgt. De taak van de AI is om het volledige bewijs te schrijven dat de punten verbindt, zonder het antwoord op internet op te zoeken. Het is alsof je een student een hoofdstuk van een tekstboek geeft met de uiteindelijke conclusie ontbrekend, en hen vraagt de ontbrekende pagina's te schrijven, gebruikmakend van alleen de aanwijzingen in dat hoofdstuk.

Het artikel introduceert deze benchmark aan de hand van 300 taken afkomstig van top-tier computerwetenschappelijke conferenties (FOCS, STOC en SODA) gepubliceerd tussen 2020 en 2026. Om de test eerlijk en schaalbaar te maken, bouwden ze een speciale "scheidsrechter"-agent—een tweede AI die getraind is om de bewijzen te beoordelen. Deze scheidsrechter is zo goed dat hij in meer dan 90% van de gevallen de oordelen van menselijke experts evenaart, waardoor het team honderden bewijzen kan testen zonder een team van menselijke wiskundigen nodig te hebben om elk afzonderlijk stuk te lezen.

Toen ze de test uitvoerden, waren de resultaten een mix van indrukwekkende vooruitgang en duidelijke grenzen. Het best presterende model, GPT 5.6 Pro, slaagde erin om ongeveer 68% van de 300 problemen correct te bewijzen. Een ander model, Gemini 3.1 DeepThink, loste 52% op. Het artikel suggereert dat, hoewel deze modellen veel beter worden in logisch redeneren, ze nog steeds worstelen met de meest complexe, meerstaps argumenten die diepe context vereisen. Sterker nog, toen de onderzoekers een slimme truc probeerden genaamd "Colosseum"—waarbij ze twee verschillende AI-modellen lieten discussiëren over het beste bewijs en de winnaar lieten kiezen—verhoogden ze het succespercentage naar 67,7%, wat aantoont dat het hebben van een tweede mening helpt, maar geen magische oplossing is.

Cruciaal is dat het artikel betoogt dat de oude manier van het testen van AI op geïsoleerde wiskundige puzzels niet langer voldoende is. Alleen omdat een model een lastige raadsel kan oplossen, betekent niet dat het echte wetenschap kan bedrijven. De auteurs ontdekten dat de grootste hindernis voor deze AI-modellen niet alleen het vinden van een slim inzicht is, maar het begrijpen van hoe je een lange keten van afhankelijkheden, definities en tussenresultaten samenweeft zonder de weg kwijt te raken. Hoewel de modellen dichter bij menselijk niveau presteren, suggereert de kloof tussen de beste AI (68%) en een perfecte score (100%) dat we nog lang niet op het punt staan om AI te hebben die menselijke onderzoekers volledig kan vervangen in het meest uitdagende theoretische werk. Het artikel concludeert dat TCS-Bench een essentieel nieuw instrument is om deze vooruitgang te volgen, wat een manier biedt om te meten hoe goed AI werkelijk kan "denken" als een wetenschapper, in plaats van alleen te memoriseren als een student.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →