← Nieuwste papers
🤖 AI

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

Dit artikel evalueert de effectiviteit van 11 open-weight Large Language Models bij het automatisch omzetten van ongestructureerde beschrijvingen van kwetsbaarheden in Connected and Autonomous Vehicles (CAV) naar gestructureerde STIX threat intelligence, waarbij een hoge nauwkeurigheid wordt aangetoond bij het identificeren van assets en zwakheden, terwijl tegelijkert het uitdagingen wordt belicht bij het mappen van complexe aanvalstechnieken.

Oorspronkelijke auteurs: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

Gepubliceerd 2026-07-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat de wereld van auto's niet langer alleen draait om metalen wielen en benzinemotoren; het is een gigantisch, rollend computernetwerk. Moderne voertuigen zitten vol sensoren, wifi en complexe software die met elkaar en met de buitenwereld communiceren. Maar net als je smartphone of laptop, heeft deze software fouten (bugs). Soms zijn deze bugs ernstige beveiligingslekken die hackers kunnen gebruiken om de controle over een auto over te nemen of gegevens te stelen. Om iedereen veilig te houden, moeten experts deze lekken snel begrijpen. De informatie over deze bugs wordt echter vaak geschreven in rommelige, platte Engelse paragrafen die moeilijk te scannen zijn. Om dit op te lossen, gebruiken experts een speciale "universele vertaler" voor dreigingen genaamd STIX. Zie STIX als een gestructureerde receptenkaart die een rommelig verhaal omzet in nette ingrediënten: wie er werd aangevallen, wat er kapot ging, hoe het werd gebroken, en wie het brak. Dit onderzoek verkent of een nieuwe generatie slimme AI-computers, bekend als Large Language Models (LLM's), die universele vertaler kan zijn, om rommelige foutrapporten automatisch om te zetten in perfecte, gestructureerde dreigingsrecepten.

De onderzoekers achter deze studie, een team van de University of Alabama, besloten deze AI-modellen specifiek te testen voor Connected and Autonomous Vehicles (CAVs). Ze wilden zien of open-source AI-modellen (het soort dat iedereen kan downloaden en draaien, niet alleen de modellen die achter de gesloten deuren van grote bedrijven zitten) een kwetsbaarheidsrapport konden lezen en direct het juiste STIX "receptenkaartje" konden genereren. Om dit te doen, moesten ze eerst hun eigen trainingsgrond bouwen. Ze creëerden een nieuwe dataset genaamd CAV-STIXGen, die 183 echte rapporten over kwetsbaarheden in auto's bevat. Voor elk rapport hebben ze handmatig het perfecte STIX-recept uitgeschreven, inclusief de specifieke onderdelen van de auto die worden aangetast, het type zwakheid en de exacte hacktechnieken die zijn gebruikt. Deze dataset werd het "antwoordenboek" om de AI-modellen te beoordelen.

Het team nodigde vervolgens 11 verschillende open-weight AI-modellen uit voor het feest, variërend van kleine, beweeglijke modellen tot massieve, zware modellen. Ze testten deze modellen met drie verschillende "onderwijsstijlen" (of promptingstrategieën). De eerste stijl was Contextless, waarbij de AI alleen het foutrapport kreeg en de rest moest raden. De tweede was STIX-guided, waarbij de AI een checklist kreeg van waar naar te zoeken. De derde was Dynamic Few-Shot, de meest behulpzame aanpak, waarbij de AI vijf voorbeelden van perfecte antwoorden te zien kreeg voordat hij aan het nieuwe probleem begon. Ze testten ook een "multi-agent" opstelling, waarbij twee verschillende AI-modellen samenwerkten als een team van detectives, waarbij de één zich richtte op het vinden van de onderdelen en de ander op het leggen van de verbanden.

De resultaten waren een mix van "wow" en "nog niet helemaal". Wanneer het ging om het simpelweg identificeren van de objecten (zoals het benoemen van een specifiek auto-onderdeel of het type kwetsbaarheid), waren de AI-modellen verrassend goed. Onder de beste onderwijsstijl (Dynamic Few-Shot) behaalden de topmodellen een score van 0,94 op 1,0, wat betekent dat ze bijna perfect waren in het opsporen van de ingrediënten. Ze waren ook uitstekend in het identificeren van het type zwakheid (zoals een specifieke programmeerfout), met een score van 0,99. De AI had echter meer moeite met de relaties—het uitzoeken van hoe een onderdeel precies met een ander onderdeel verbonden is in een logische keten. Het beste model voor deze taak bereikte slechts een score van 0,63. Het is alsof de AI perfect de ingrediënten voor een taart kan opsommen, maar soms vergeet te zeggen dat de eieren in het beslag gaan, en niet erop.

De meest complexe taak was het mappen van de kwetsbaarheden naar MITRE ATT&CK-technieken, die als een bibliotheek van bekende hackerbewegingen fungeren. Dit bleef de grootste uitdaging. Hoewel de modellen vaak tenminste één correcte hacktechniek konden vinden (met scores tot 0,68 voor het vinden van één techniek), misten ze vaak het volledige plaatje wanneer een enkele bug betrokken was bij meerdere aanvalsmethoden. De onderzoekers ontdekten dat hoewel het verdelen van het werk tussen twee AI-agents hielp bij het vinden van objecten, dit de problemen met de relaties niet consistent oploste.

Door de verzamelde gegevens te analyseren, ontdekte het team ook terugkerende patronen in de manier waarop car-hackers opereren. Ze ontdekten dat de meest voorkomende zwakheden in auto's te maken hebben met geheugenveiligheidsproblemen (zoals het schrijven van gegevens waar ze niet thuishoren) en onjuiste toegangscontrole (mensen binnenlaten die daar niet horen te zijn). De meest frequente hacktechnieken betroffen denial of service (het overbelasten van de systemen van de auto) en het exploiteren van client-side software. De gegevens suggereren dat deze aanvallen vaak in paren voorkomen, zoals het exploiteren van een clientprogramma en vervolgens het veroorzaken van een systeemcrash.

Kortom, dit artikel suggereert dat hoewel AI een krachtig hulpmiddel wordt voor het automatiseren van de beveiligingsanalyse van auto's, het nog niet een "instellen en vergeten"-oplossing is. De AI kan een fantastisch werk leveren bij het opsporen van de puzzelstukjes, maar heeft nog steeds menselijke begeleiding en betere voorbeelden nodig om te begrijpen hoe die stukjes perfect in elkaar passen. De onderzoekers hopen dat zij door het verstrekken van deze nieuwe dataset en het laten zien waar de AI slaagt en faalt, beveiligingsteams beter in staat stellen om tools te bouwen om onze toekomstige autonome voertuigen veilig te houden voor digitale dreigingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →