← Nieuwste papers
💻 computer science

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

Dit artikel presenteert een gecontroleerde studie die aantoont dat GPT-4 (Advanced Data Analysis) geaggregeerde SAST-tools (SonarQube en Cloud Defence) aanzienlijk overtreft bij het detecteren van programmeerkwetsbaarheden over 32 beveiligingsscenario's, waarbij een detectiepercentage van 93,75% wordt bereikt vergeleken met 34,375% met statistische significantie.

Oorspronkelijke auteurs: Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

Gepubliceerd 2026-07-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die probeert een sluwe dief te vangen die zich verbergt in de code van een computerprogramma. Jarenlang heb je vertrouwd op een team van robotinspecteurs (SAST-tools) om de code te scannen. Deze robots zijn geweldig in het volgen van een strikte checklist: "Als je een rode deur ziet, markeer deze." Maar soms verbergt de dief zich achter een blauwe deur die op een rode lijkt, of gebruikt hij een truc die de checklist niet kent. De robots missen deze sluwe trucs, of ze raken in de war en markeren onschuldige zaken als gevaarlijk.

Nu is er een nieuwe detective bij het team gekomen: GPT-4, een superintelligente AI die code leest als een verhaal. De grote vraag was: Kan deze nieuwe AI-detective de lastige beveiligingslekken beter opsporen dan de oude robotinspecteurs?

De Grote Detective Showdown

Om dit uit te zoeken, hebben de onderzoekers een eerlijke test opgezet. Ze creëerden 32 specifieke "plaatsen delict" (beveiligingsscenario's) gebaseerd op echte programmeerfouten, zoals het open laten staan van een achterdeur of het laten binnendringen van kwaadwillenden met valse commando's. Ze gaven deze scenario's aan:

  1. Het Robotteam: Twee verschillende robotinspecteurs (SonarQube en Cloud Defence). Zij werkten samen, en als één van de robots een probleem ontdekte, telde dat als een overwinning voor de robots.
  2. De AI-detective: GPT-4, die werd gevraagd de code te lezen en uit te leggen wat er mis was.

Het Scorebord

Dit is wat er gebeurde toen ze de resultaten vergeleken:

  • Het Robotteam: Zij ontdekten 11 van de 32 misdaden. Dat is ongeveer 34% van de tijd.
  • De AI-detective: GPT-4 ontdekte 30 van de 32 misdaden. Dat is een indrukwekkend succespercentage van 93,75%!

De onderzoekers gebruikten een speciale wiskundige test (de McNemar-test) om te controleren of dit niet gewoon geluk was. De uitslag was een duidelijk "ja": de AI-detective was statistisch gezien veel beter in het vinden van deze specifieke bugs dan het robotteam in dit gecontroleerde experiment.

Wat dit betekent (en wat het niet betekent)

Het paper suggereert dat AI zoals GPT-4 een krachtige sidekick kan zijn voor de robotinspecteurs. Het is geweldig in het begrijpen van het verhaal achter de code en het opsporen van complexe trucs die rigide checklists missen. Dit kan ontwikkelaars helpen om lekken sneller te repareren en misschien zelfs geld besparen op dure tools.

Echter, het paper is zeer voorzichtig met de bewering dat de robots overbodig zijn.

  • Het is geen toverstaf: De AI is niet perfect. Het miste 2 van de 32 gevallen, en de robots vonden enkele dingen die de AI miste.
  • Het is geen vervanging: De auteurs betogen dat we de robots niet zomaar moeten weggooien. In plaats daarvan moeten we de AI gebruiken om de robots te helpen, vooral bij lastige gevallen die menselijk redeneren vereisen.
  • Nieuwe gevaren: Het paper waarschuwt dat het gebruik van AI ook nieuwe risico's met zich meebrengt. Net zoals een dief een robot kan misleiden, zou een kwaadwillende de AI kunnen misleiden (door middel van zaken als "prompt injection" of het verbergen van slechte instructies in de trainingsdata). Als we niet voorzichtig zijn, kan de AI zelfs code genereren die er veilig uitziet, maar in werkelijkheid vol gaten zit.

De Kern van het Verhaal

In deze specifieke test met 32 zorgvuldig gekozen voorbeelden, bewees de AI-detective dat hij dingen kon zien die de robotinspecteurs misten. Maar de onderzoekers zeggen dat dit pas het begin is. We moeten voorzichtig zijn, blijven testen en onthouden dat hoewel de AI een briljant nieuw instrument is, het nog geen opgelost probleem is. Het is een krachtige partner, maar er is nog steeds een mens nodig om met de zaklamp te schijnen en het werk te controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →