← Neueste Arbeiten
💬 NLP

IndustryCode: A Benchmark for Industry Code Generation

Das Paper stellt IndustryCode vor, den ersten umfassenden Benchmark, der speziell entwickelt wurde, um die Fähigkeiten von Large Language Models bei der Codegenerierung über verschiedene industrielle Domänen (wie Finanzen, Luft- und Raumfahrt) und Programmiersprachen hinweg zu evaluieren und so die Lücke zwischen bestehenden Tests und den Anforderungen komplexer realer Szenarien zu schließen.

Ursprüngliche Autoren: Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

Veröffentlicht 2026-04-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: KI kann gut kochen, aber nicht im Kraftwerk arbeiten

Stell dir vor, du hast einen extrem talentierten Koch (eine KI), der in der Lage ist, die besten Rezepte der Welt nachzudichten. Wenn du ihn bittest, einen Burger zu braten oder eine Pizza zu backen (das ist das, was wir „Alltags-Code" nennen, wie einfache Webseiten oder Apps), dann ist er ein Meister.

Aber was passiert, wenn du ihn bittest, die Steuerung für eine Rakete zu programmieren, die Finanzdaten für eine Bank zu berechnen oder die Roboter in einer Fabrik zu steuern? Plötzlich stolpert er. Warum? Weil die bisherigen Tests für KIs nur „Burger-Rezepte" waren. Sie haben nie geprüft, ob der Koch auch mit den strengen Sicherheitsvorschriften eines Atomkraftwerks oder den komplexen Formeln eines Astronomen zurechtkommt.

Die Lösung: IndustryCode – Der „Industrie-Prüfstand"

Die Autoren dieses Papers haben sich gedacht: „Das reicht nicht!" Sie haben IndustryCode erfunden. Das ist wie ein riesiger, neuer Prüfstand, der speziell dafür gebaut wurde, KIs auf ihre Tauglichkeit für echte, harte Industriearbeit zu testen.

Stell dir IndustryCode wie einen großen Baukasten vor, der aus 125 riesigen, komplexen Projekten besteht (z. B. „Baue ein System zur Vorhersage von Erdbeben" oder „Optimiere den Energieverbrauch einer ganzen Stadt").

Aber hier ist der Clou: Diese riesigen Projekte sind nicht als eine einzige, undurchdringliche Wand aufgebaut. Sie sind in 579 kleine, überschaubare Bausteine zerlegt.

  • Die Hauptaufgabe (Main Problem): Das ist der ganze Bauauftrag.
  • Die Teilaufgaben (Sub-problems): Das sind die einzelnen Schritte: „Schraube diese Platte fest", „Verbinde diesen Draht", „Berechne diesen Wert".

Die KI muss nicht nur den einzelnen Schritt richtig machen, sondern alle Schritte so zusammenfügen, dass am Ende das ganze Gebäude steht und nicht einstürzt.

Was macht diesen Test so besonders?

  1. Vielfalt statt Einheitsbrei: Bisherige Tests waren oft nur auf einer Sprache (Python) und in einem Bereich (Webentwicklung) festgefahren. IndustryCode ist wie ein multikulturelles Team: Es nutzt verschiedene Sprachen (Python, C++, MATLAB, Stata) und deckt völlig unterschiedliche Welten ab – von der Luft- und Raumfahrt über die Chemie bis hin zur Finanzwelt.
  2. Echte Probleme, keine Fake-Aufgaben: Die Aufgaben stammen nicht aus Schulbüchern, sondern aus echten, alten Industrieprojekten. Es ist, als würdest du einen Koch nicht mit einem Kochbuch testen, sondern mit den echten, verschmierten Notizen eines erfahrenen Küchenchefs, der schon 30 Jahre arbeitet.
  3. Die „Störungs-Sperre": Damit die KI nicht einfach nur auswendig gelernt hat, was sie im Internet gelesen hat, haben die Autoren die Aufgaben absichtlich verändert und schwieriger gemacht. Es ist, als würdest du einem Schüler eine Matheaufgabe geben, bei der die Zahlen leicht verändert wurden, damit er die Logik anwenden muss und nicht nur die Lösung auswendig sagt.

Was haben sie herausgefunden? (Die Ergebnisse)

Sie haben die besten KIs der Welt (wie Claude, GPT, Gemini) auf diesen Prüfstand gestellt. Das Ergebnis war eine Mischung aus „Wow" und „Oh nein":

  • Die Spitze ist gut, aber nicht perfekt: Der Gewinner, Claude 4.5 Opus, hat bei den kleinen Teilaufgaben etwa 68 % richtig gemacht. Das ist beeindruckend! Aber bei den großen, ganzen Projekten (wo alles zusammenpassen muss) fiel die Quote auf 42 %.
  • Das „Zusammenbau-Problem": Die KIs sind super darin, einzelne Sätze zu schreiben (Teilaufgaben). Aber sie scheitern oft daran, diese Sätze zu einem ganzen, fehlerfreien Roman zusammenzufügen (Hauptaufgabe). Es ist, als ob ein Schreiner perfekt einzelne Stühle bauen kann, aber wenn er ein ganzes Haus bauen soll, passen die Türen nicht zu den Wänden.
  • Sprachen machen den Unterschied: KIs sind in Python (die „Alltagssprache" der Programmierer) sehr stark. Aber bei Nischensprachen wie Stata (für Statistiker) oder MATLAB (für Ingenieure) waren sie oft völlig ratlos. Das liegt daran, dass diese Sprachen im Internet viel seltener vorkommen, die KI also weniger „gelesen" hat.
  • Denken hilft, aber verwirrt auch: Manche KIs haben eine „Denk-Phase" (wie ein Mensch, der erst nachdenkt, bevor er schreibt). Das hilft bei komplexer Logik, führt aber manchmal dazu, dass die KI den Kontext verliert und Dinge in den Code schreibt, die dort nicht hingehören (wie eine Erklärung mitten in einer Programmiersprache).

Die große Erkenntnis

IndustryCode zeigt uns: KI ist ein brillanter Assistent, aber noch kein vollwertiger Ingenieur.

Sie kann uns helfen, den ersten Entwurf zu schreiben, Formeln zu prüfen oder Code zu optimieren. Aber wenn es um die Sicherheit einer Rakete oder die Stabilität eines Finanzsystems geht, müssen wir Menschen noch genau prüfen, was die KI geschrieben hat. Der Weg zur „Industrie-KI", die sich allein durch komplexe Fabriken oder Banken navigieren kann, ist noch lang – aber mit diesem neuen Test (IndustryCode) wissen wir endlich genau, wo die Schwachstellen liegen und wie wir die KI verbessern können.

Kurz gesagt: IndustryCode ist der erste echte „Führerschein-Test" für KIs, um zu sehen, ob sie wirklich fit sind für die harte Arbeit in der echten Welt – und nicht nur für das Spielen im Internet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →