← Nieuwste papers
🤖 AI

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

Om de beperkingen van bestaande benchmarks bij het evalueren van door LLM's gegenereerde Triton-kernels aan te pakken, introduceren de auteurs RealisticTritonBench, een nieuwe benchmark afgeleid van real-world framework pull requests die een realistische, end-to-end prestatie-evaluatie mogelijk maakt en onthult dat huidige toonaangevende LLM's nog steeds moeite hebben met dergelijke taken.

Oorspronkelijke auteurs: Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu

Gepubliceerd 2026-08-13
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat het digitale brein van een moderne AI een bruisende stad is. De wolkenkrabbers zijn de enorme neurale netwerken, maar de echte magie vindt plaats in de kleine, hogesnelheidstunnels van de metro die data tussen hen door verplaatsen. Deze tunnels worden "GPU-kernels" genoemd. Jarenlang vereiste het bouwen van deze tunnels een team van elite-ingenieurs die een moeilijke, oude taal spraken genaamd CUDA. Het was traag, duur en foutgevoelig. Toen kwam er een nieuwe, eenvoudigere taal genaamd Triton. Het is alsof je ingenieurs een set Lego-blokjes geeft die in elkaar klikken om dezelfde hogesnelheidstunnels te bouwen, maar dan met een veel simpelere handleiding.

Onlangs begonnen wetenschappers een grote vraag te stellen: kan Kunstmatige Intelligentie (AI) leren om deze Lego-tunnels voor ons te bouwen? Als een superintelligent computerprogramma (een Large Language Model) automatisch de code voor deze tunnels zou kunnen schrijven, zou het mensen ontelbare uren werk besparen. Maar hier zit de adder onder het gras: alleen omdat een tunnel in een blauwdruk op een werkend ontwerp lijkt, betekent dit nog niet dat hij niet zal instorten wanneer de hele stad erop draait. Om erachter te komen of AI echt klaar is om een tunnelarchitect te zijn, hadden onderzoekers een betere manier nodig om het te testen. Ze hadden een test nodig die niet alleen controleerde of de bakstenen pasten, maar ook of het hele metrosysteem daadwerkelijk sneller liep en de stad niet liet crashen.

Hier komt een nieuwe studie genaamd RealisticTritonBench kijken. Denk aan dit als een gigantische, realistische "rijexamen" voor AI-ingenieurs. In plaats van de AI te vragen om een enkel Lego-blokje te bouwen in een stille kamer, gaven de onderzoekers het echte klussen uit de praktijk, afkomstig van echte, drukke bouwplaatsen (populaire AI-softwareframeworks zoals PyTorch en vLLM). Ze vroegen de AI om kapotte tunnels te repareren, bestaande tunnels sneller te maken, of volledig nieuwe tunnels vanaf nul op te bouwen, terwijl de stad gewoon doordraaide.

De resultaten waren een flinke reality check. De onderzoekers testten de slimste AI-modellen die beschikbaar zijn, inclusief reuzen zoals GPT-5.4 en Qwen3.5. Ze ontdekten dat hoewel deze AI's beter worden in het schrijven van code, ze nog steeds worstelen met de rommelige, echte wereld van het bouwen van GPU-kernels. Sterker nog, de AI voltooide de volledige taak — alle tests doorstaan, de nauwkeurigheid van het AI-brein behouden én daadwerkelijk zaken versnellen — slechts in 18,71% van de gevallen.

En dit is de kern van het probleem: zelfs wanneer de code van de AI slaagde voor de basis "unit tests" (zoals controleren of een enkel Lego-stukje past), faalde het vaak in het grotere plaatje. Ongeveer de helft van de tijd maakte de code van de AI het AI-brein minder nauwkeurig, en gemiddeld maakten de nieuwe tunnels het systeem niet sneller dan de oude. In sommige gevallen genereerde de AI code die correct leek, maar in een echte toepassing de boel juist zou vertragen.

De studie suggereert dat AI weliswaar een geweldige assistent is voor het schrijven van eenvoudige code, maar dat het nog steeds een diep, intuïtief begrip mist van hoe deze complexe systemen met elkaar interageren. Het is als een student die de verkeersregels uit zijn hoofd heeft geleerd, maar nog niet heeft geleerd hoe hij moet rijden in een stormachtige, drukke stad. De onderzoekers hebben deze nieuwe benchmark gebouwd om te voorkomen dat AI simpelweg "het systeem bespeelt" en om het te dwingen te bewijzen dat het de echte, belangrijke taken aankan om onze digitale wereld soepel te laten draaien. Totdat AI deze realistische test consistent kan halen, zullen menselijke experts nog steeds degene moeten zijn die de blauwdrukken vasthouden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →