← Nieuwste papers
🤖 AI

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

Dit artikel introduceert "Pre-Flight", een open-source benchmark van 300 door experts geschreven meerkeuzevragen die ontworpen zijn om grote taalmodellen te evalueren op operationele luchtvaartkennis, waarbij wordt onthuld dat zelfs de meest geavanceerde modellen momenteel aanzienlijk tekortschieten in expert-niveau betrouwbaarheid en waarbij de noodzaak van domeinspecifieke evaluatie voor verantwoorde AI-implementatie in de luchtvaart wordt benadrukt.

Oorspronkelijke auteurs: Alex Brooker, Tim Hughes

Gepubliceerd 2026-07-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Alex Brooker, Tim Hughes

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de luchtvaartindustrie voor als een enorme, ongelooflijk complexe bibliotheek. Binnenin staan miljoenen boeken: sommige zijn glimmende nieuwe digitale handleidingen, terwijl andere stoffige, handgeschreven logboeken uit de jaren '60 zijn. Deze bibliotheek bevat de regels voor hoe vliegtuigen zich op de grond bewegen, hoe je communiceert met de luchtverkeersleiding en hoe je passagiers veilig houdt.

Een lange tijd hebben we geprobeerd computers (specifiek Large Language Models of "LLM's") te leren deze bibliotheek te lezen en als behulpzame assistenten op te treden. Maar hier is het probleem: we hebben deze computers getest met algemene trivia-vragen, zoals "Wie was de eerste president?" of "Wat is de hoofdstad van Frankrijk?".

Het Probleem: De "Algemene Kennis"-valstrik
De auteurs van dit artikel stellen dat het passeren van een algemene trivia-test niet betekent dat een computer klaar is om te werken op een luchthaven. Het is alsof je de bekwaamheid van een piloot om een vliegtuig te vliegen test door hem te vragen de tekst van een popliedje op te zeggen. Ze kunnen de woorden misschien perfect kennen, maar dat betekent niet dat ze een storm of een mechanisch defect kunnen afhandelen. In de luchtvaart is een fout antwoord niet alleen een slecht cijfer; het kan geld kosten, reputatie schaden, of erger.

De Oplossing: "Pre-Flight"
Om dit op te lossen, hebben de auteurs een nieuwe test ontwikkeld genaamd Pre-Flight. Zie dit als een gespecialiseerd "rijexamen" specifiek voor grondoperaties op luchthavens.

  • De Test: Deze bestaat uit 300 meerkeuzevragen.
  • De Bron: De vragen komen uit echte, officiële regelboeken (zoals de internationale ICAO-standaarden en de Amerikaanse FAA-regelgeving) en veiligheidshandboeken die door echte piloten en grondpersoneel worden gebruikt.
  • De Beoordelaars: De vragen zijn geschreven en gecontroleerd door echte luchtvaartexperts—mensen die daadwerkelijk het luchtverkeer hebben beheerd, vliegtuigen hebben gevlogen en op het platform hebben gewerkt.

De Resultaten: De "Expert Gap"
De auteurs hebben de slimste beschikbare AI-modellen (tot medio 2026) deze test voorgelegd. Dit is wat ze ontdekten:

  1. De Menselijke Benchmark: Wanneer een kleine groep echte luchtvaartprofessionals een vergelijkbare quiz aflegden, scoorden zij ongeveer 95%. Dit is de "gouden standaard" van betrouwbaarheid.
  2. De AI-Prestaties: Het allerbeste AI-model haalde een score van 82,7%.
  3. De Kloof: Er is een aanzienlijke kloof tussen de AI en de menselijke experts. Hoewel de AI-scores verbeteren, gaan ze erg langzaam vooruit. Het is als een student die twee jaar lang heeft gestudeerd en eindelijk van een 75% naar een 83% is gegaan, maar nog steeds niet de 95% heeft bereikt die nodig is om met onderscheiding te slagen.

Waarom gebeurt dit?
Het artikel suggereert een paar redenen voor de strijd:

  • Amerikaanse Regelgeving is Tricky: De AI-modellen hadden de meeste moeite met specifieke Amerikaanse regels (FAA). Dit kan komen doordat deze specifieke details minder vaak voorkomen in de algemene internetdata waarop de AI is getraind, vergeleken met internationale regels.
  • Redeneren versus Onthouden: De AI is goed in het onthouden van feiten (zoals "Wat is de snelheidslimiet?"), maar raakt in de war wanneer het complexe logica moet uitvoeren (zoals "Als het sneeuwt en de landingsbaan is kort, welke gate moeten we dan gebruiken?").
  • Overmoed: Soms is de AI zeer zelfverzekerd in haar foute antwoorden, wat gevaarlijk is in een sector met hoge inzet zoals de luchtvaart.

De "Outlier" en de "Hard Mode"

  • Eén model (ALLaM 2 7B) scoorde slechts 25,3%, wat in feilen neerkomt op willekeurig gokken. Dit laat zien dat een model uitstekend kan zijn in andere zaken, maar volledig kan falen wanneer het wordt geconfronteerd met luchtvaartspecifieke regels.
  • De auteurs vermelden ook dat ze een "Hard Mode"-versie van de test bouwen die nog moeilijker is. Ze houden deze vooralsnog privé, zodat naarmate de AI slimmer wordt, ze kunnen blijven testen zonder dat de AI heeft "gespeeld" door de antwoorden uit het internet te memoriseren.

De Kern van de Zaak
Het artikel concludeert dat voordat we AI taken laten afhandelen die belangrijk zijn maar niet direct de veiligheid beïnvloeden (zoals planning of klantenservice) in de luchtvaart, we moeten bewijzen dat het deze specifieke "Pre-Flight" test kan halen. Momenteel is de AI daar nog niet klaar voor. Het is een veelbelovende student, maar het is nog niet klaar om de kapitein van het schip te zijn.

Wat het papier NIET zegt:

  • Het zegt niet dat AI moet worden gebruikt voor veiligheidskritische taken (zoals het daadwerkelijk besturen van het vliegtuig of het nemen van noodbeslissingen).
  • Het beweert niet dat AI binnenkort menselijke piloten of grondpersoneel zal vervangen.
  • Het suggereert niet dat de huidige AI-scores goed genoeg zijn voor onmiddellijke, onbewaakte inzet in de echte operaties.

De belangrijkste boodschap is simpel: We hebben een gespecialiseerde test nodig voor de luchtvaart, en op dit moment slaagt de AI er niet in om het niveau van een menselijke expert te bereiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →