IndustryCode: A Benchmark for Industry Code Generation
Dit paper introduceert IndustryCode, het eerste uitgebreide benchmark voor het genereren van industriële code dat diverse sectoren en programmeertalen bestrijkt om de generalisatievermogens van grote taalmodellen in complexe industriële scenario's te evalueren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Samenvatting: IndustryCode – De "Rijbewijs" voor AI in de echte wereld
Stel je voor dat je een robot hebt die heel goed kan koken. Als je vraagt om een boterham met kaas, maakt hij die perfect. Maar als je vraagt om een complex gerecht voor een ruimtevaartmissie, of een medicijnrecept dat exacte chemische berekeningen vereist, faalt hij. Waarom? Omdat hij alleen is getraind op simpele recepten uit internet, niet op de strenge regels van de echte industrie.
Dit is precies het probleem dat deze paper, IndustryCode, aanpakt.
1. Het Probleem: De "Schoolvoorbeeld"-valkuil
Tot nu toe hebben we AI-modellen (zoals ChatGPT of Claude) getest met simpele programmeeropdrachten. Dit is alsof we een piloot testen door te vragen of hij een vliegtuig op de grond kan parkeren. Dat is makkelijk. Maar in de echte wereld moet die piloot ook in stormweer vliegen, met een defecte motor, en een landingsbaan vinden die niet op de kaart staat.
Bestaande tests kijken alleen naar de "parkeren"-vaardigheden. Ze missen de complexiteit van echte industrieën zoals:
- Financiën: Waar een rekenfout van één cent miljoenen kan kosten.
- Ruimtevaart: Waar code moet voldoen aan de zwaartekracht en straling.
- Agricultuur & Chemie: Waar je exacte mengsels nodig hebt.
2. De Oplossing: IndustryCode (De "Grote Proef")
De auteurs hebben een nieuwe test ontwikkeld, genaamd IndustryCode. Denk hierbij niet aan een meerkeuzetoets, maar aan een realityshow voor programmeer-AI's.
- De Opdracht: In plaats van "schrijf een functie die twee getallen optelt", krijgen de AI's een groot, complex project. Bijvoorbeeld: "Bouw een systeem dat de stabiliteit van een vliegtuigvleugel berekent en waarschuwt als het te warm wordt."
- De Structuur: Deze grote opdracht is opgesplitst in kleine, logische stapjes (sub-problemen). De AI moet eerst de basis leggen, dan de onderdelen bouwen, en ze uiteindelijk aan elkaar naaien tot één werkend geheel.
- De Talen: Het is niet alleen Python (de taal van de hobbyist). Het bevat ook MATLAB (voor ingenieurs), C++ (voor snelle systemen) en Stata (voor statistici). Dit is als een test waarbij de kandidaat niet alleen moet kunnen koken, maar ook moet kunnen bakken, grillen en sushi maken.
3. Wat hebben ze ontdekt? (De Uitslag)
Ze hebben de slimste AI's van dit moment (zoals Claude, GPT-5, en Qwen) op deze test laten werken. De resultaten zijn een mix van "wow" en "oh nee":
- De Winnaar: De model Claude 4.5 Opus deed het het beste, maar zelfs hij haalde slechts 42,5% op de grote projecten. Dat klinkt laag, maar onthoud: dit is alsof een beginnende piloot in een stormvliegtuig de landingsbaan net mist, terwijl hij de simpele parkeerproef wel haalde.
- De Grootste Uitdaging: De AI's zijn goed in het maken van losse stukjes code (de "sub-problemen"), maar ze haken vaak af als ze alles moeten samenvoegen tot één groot systeem. Ze kunnen een baksteen perfect maken, maar bouwen er geen stabiel huis van.
- De "Denk"-valstrik: Sommige AI's hebben een "denk-modus" (waarbij ze eerst nadenken voordat ze antwoorden). Dit helpt bij wiskundige problemen, maar zorgt er vaak voor dat ze in de war raken over de instructies zelf. Het is alsof iemand die te lang nadenkt over een recept, vergeet dat hij eigenlijk een taart moet bakken en per ongeluk een pizza maakt.
4. Waarom is dit belangrijk?
Voor nu zijn AI's als handige assistenten die je helpen met simpele taken. Maar voor de echte industrie (ziekenhuizen, fabrieken, banken) is betrouwbaarheid alles. Als een AI code schrijft voor een kerncentrale, mag hij geen fouten maken.
IndustryCode is de eerste echte "rijbewijstest" die laat zien waar AI's nu echt staan. Het laat zien dat we nog een lange weg te gaan hebben voordat we AI volledig kunnen vertrouwen met complexe, industriële taken.
Kortom:
Deze paper zegt: "Stop met het testen van onze robots met simpele puzzels. Laten we ze in de modderige, moeilijke wereld van de echte industrie zetten, zodat we zien of ze echt kunnen werken of alleen maar kunnen praten."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.