← Nieuwste papers
🤖 AI

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

Het Engineering Reasoning and Instruction (ERI)-benchmark is een uitgebreide, taxonomie-gedreven dataset die negen ingenieursdomeinen bestrijkt en is ontwikkeld om foundation modellen en agents te trainen en evalueren, waarbij een nieuwe validatieprotocol de hallucinatiekans beperkt tot 1,7% en een duidelijke prestatiehiërarchie tussen verschillende LLM's blootlegt.

Oorspronkelijke auteurs: MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

Gepubliceerd 2026-03-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De ERI-Benchmark: Een Grote "Rijbewijstest" voor AI in de Ingenieurswereld

Stel je voor dat je een nieuwe chauffeur wilt inhuren voor een lastige vrachtwagen die door een bergdorp moet rijden. Je zou niet tevreden zijn met iemand die alleen maar goed kan praten over hoe een auto werkt. Je wilt weten of ze ook echt kunnen schakelen, remmen, en wat ze doen als de remmen falen.

Dit is precies het probleem dat deze nieuwe wetenschappelijke paper aanpakt. De auteurs hebben een gigantische test ontwikkeld, genaamd ERI (Engineering Reasoning and Instruction), om te kijken of kunstmatige intelligentie (AI) écht slim is in de ingenieurswereld, of dat het alleen maar goed kan "kletsen".

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Alles-kunner" die faalt bij details

Tot nu toe werden AI-modellen getest met algemene vragen, zoals "Wie was de eerste president?" of "Los deze wiskundepuzzel op". Dit is alsof je een vrachtwagenchauffeur test op een leeg parkeerterrein. Ze doen het misschien goed, maar dat zegt niets over of ze veilig kunnen rijden in de regen of op een smalle bergweg.

In de echte wereld van ingenieurs (bouwen, bruggen, machines, elektriciteit) gaat het niet om mooie antwoorden, maar om veiligheid en precisie. Als een AI een brug ontwerpt en één boutje vergeet, kan dat rampzalig zijn. Bestaande tests zien dit soort "stille fouten" vaak niet.

2. De Oplossing: De "Grote Ingenieurs-Checklist"

De auteurs hebben een enorme database gemaakt met 57.750 vragen. Dit is hun "rijbewijstest" voor AI. Ze hebben deze test opgebouwd als een soort super-organiseerder:

  • 9 Wereldwijken (Vakgebieden): Denk aan Civiele techniek (bruggen), Werktuigbouwkunde (machines), Elektrotechniek, Chemie, en nog 5 andere.
  • 55 Buurten (Subgebieden): Binnen die wijken zijn er specifieke straten, zoals "staalconstructies" of "luchtverkeer".
  • 7 Soorten Taken: Van "Leg uit wat dit woord betekent" tot "Bereken dit getal", "Ontwerp een machine", of "Vind de fout in dit systeem".
  • 3 Moeilijkheidsgraden:
    • Student: Basisvragen (zoals voor het theorie-examen).
    • Master: Complexere vragen (zoals een proefexamen).
    • Pro: Echte beroepspraktijk (waar je echt verantwoordelijkheid draagt).

Het resultaat is een test die je kunt gebruiken om te zien of een AI echt begrijpt wat hij doet, of dat hij alleen maar raadt.

3. De Testresultaten: Wie rijdt er veilig?

De auteurs hebben 7 verschillende AI-modellen op deze test laten rijden. Het resultaat was duidelijk:

  • De "F1-chauffeurs" (De beste AI's): Modellen zoals GPT-5 en Claude Sonnet 4 deden het fantastisch. Ze scoorden bijna perfect, zelfs bij de moeilijkste vragen. Ze lijken op ervaren ingenieurs die weten wat ze doen.
  • De "Oefenchauffeurs" (Middelmatige AI's): Deze modellen deden het okay bij simpele vragen, maar vielen flink door de mand bij moeilijke vragen.
  • De "Leerlingen" (Kleine AI's): De kleinere modellen (zoals Llama 3.1 8B) faalden vaak. Ze gaven soms antwoorden die er goed uitzagen, maar die in de praktijk gevaarlijk of onzin waren. Ze hadden een faalpercentage van meer dan 10%.

Belangrijke les: Hoe kleiner en simpeler de AI, hoe meer hij "raadt" in plaats van "redeneren". Voor echte ingenieurswerkzaamheden zijn de kleine modellen dus nog niet veilig genoeg.

4. De "Gevarencontrole": Hoe weten we dat de test niet vals is?

Een groot probleem bij AI-tests is: "Wie heeft de antwoorden bedacht? Misschien heeft de AI zelf de antwoorden verzonnen en is de test dus vals!"

De auteurs hebben hier slim op gereageerd met een drie-sporen controle:

  1. Ze hebben de vragen gegenereerd door één AI.
  2. Ze hebben de antwoorden laten controleren door drie andere AI's van verschillende bedrijven (alsof je drie verschillende keurmeesters hebt).
  3. Ze hebben gekeken of de "beste" AI's het eens waren over de antwoorden.

Het resultaat? Ze hebben bewezen dat de kans op "hallucinaties" (verzonnen feiten) extreem laag is (minder dan 2%). Het is dus een eerlijke test.

5. Wat betekent dit voor de toekomst?

Deze paper is een waarschuwing en een hulpmiddel:

  • Waarschuwing: Gebruik geen kleine AI-modellen voor belangrijke dingen zoals het ontwerpen van gebouwen of het regelen van stroomnetten. Ze kunnen fouten maken die je niet ziet.
  • Hulpmiddel: De beste AI's kunnen wel een geweldig hulpmiddel zijn voor ingenieurs, net als een super-slimme assistent die snel rekeningen maakt of ideeën genereert. Maar de mens moet altijd de laatste handtekening zetten.

Kortom: De auteurs hebben een "rijbewijstest" voor AI in de techniek gemaakt. Ze laten zien dat de slimste AI's nu bijna net zo goed zijn als echte ingenieurs, maar dat de kleinere modellen nog veel te onbetrouwbaar zijn voor het echte werk. De dataset is nu gratis beschikbaar voor iedereen om nieuwe AI's te testen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →