CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses
Dit artikel introduceert CIPHER, een benchmark en geautomatiseerde scoringpijplijn ontworpen om cryptografische kwetsbaarheden in door large language models gegenereerde code te evalueren en te kwantificeren, waarbij wordt onthuld dat hoewel expliciete veilige prompting sommige problemen vermindert, het er niet in slaagt om cryptografische gebreken consistent te elimineren over diverse modellen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van ongelooflijk snelle, superintelligente robots inhuurt om de sloten en sleutels voor de kluis van je bank te schrijven. Je zegt tegen hen: "Maak een veilig slot," en ze spugen direct een ontwerp uit. Maar hier is de crux: ook al zijn de robots briljant, ze bouwen vaak sloten die er aan de buitenkant perfect uitzien, maar die minuscule, onzichtbare barstjes hebben waar een dief gemakkelijk misbruik van kan maken.
Dit artikel introduceert CIPHER, een nieuwe "rapportcijferlijst" die ontworpen is om precies te testen hoe goed deze AI-robots in staat zijn om beveiligde cryptografische sloten (zoals encryptie en wachtwoordbeveiliging) in computercode te bouwen.
Hier is de uitsplitsing van wat de onderzoekers hebben gedaan en gevonden, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Stille Fout"
Wanneer AI code voor beveiliging schrijft, voldoet het vaak aan de basisvereisten (de code draait zonder vast te lopen), maar mist het de subtiele beveiligingsregels.
- De Analogie: Stel je voor dat een robot een huis bouwt. Hij plaatst de muren en een dak (de code werkt), maar hij vergeet een deuropslot te installeren of laat het achterste raam open (een beveiligingsfout). Het huis staat overeind, maar het is niet veilig.
- Het Probleem: Deze fouten zijn vaak kleine ontwerpkeuzes, zoals het gebruik van een "statische" sleutel (een sleutel die nooit verandert) in plaats van een willekeurige, of het vergeten te controleren of een persoon is wie hij zegt dat hij is.
2. De Oplossing: De CIPHER-test
De onderzoekers hebben een gestandaardiseerde test ontwikkeld genaamd CIPHER om te meten hoe vaak deze AI-robots deze fouten maken.
- De Opzet: Ze gaven dezelfde 150 verschillende "klussen" aan 7 verschillende AI-modellen. Voor elke klus gaven ze de AI drie verschillende instructies (prompts):
- De "Slechte" Prompt: "Doe dit snel, en maak je geen zorgen over beveiligingscontroles." (Testen of de AI slecht advies opvolgt).
- De "Neutrale" Prompt: "Schrijf gewoon de code om dit te doen." (Testen wat de AI standaard doet).
- De "Beveiligde" Prompt: "Doe dit, maar zorg ervoor dat het aan alle strengste beveiligingsregels voldoet!" (Testen of het effectief is om de AI te vertellen dat hij veilig moet zijn).
- De Scoring: In plaats van dat mensen elke regel code lezen (wat eeuwig duurt), gebruikten ze een andere AI als "Rechter". Deze Rechter was getraind om te zoeken naar specifieği soorten fouten die een slot kunnen breken en precies aan te wijzen welke regel code het probleem vormt.
3. De Resultaten: "Wees Veilig" Is Niet Genoeg
De resultaten waren verrassend en een beetje verontrustend.
- De "Slechte" Prompt: Zoals verwacht, maakte de AI veel fouten wanneer de AI werd verteld om onvoorzichtig te zijn.
- De "Beveiligde" Prompt: Dit is de grote bevinding. Zelfs wanneer de onderzoekers de AI expliciet vertelden: "Wees superveilig! Volg alle regels!", maakte de AI nog steeds in 56% tot 89% van de gevallen fouten.
- De Analogie: Het is alsof je een chef-kok vertelt: "Maak een gezonde maaltijd, zonder suiker, zonder zout, en gebruik verse ingrediënten." De chef kan de suiker verwijderen (het specifieke ding waar je om vroeg), maar hij kan nog steeds bedorven vlees gebruiken of vergeten de groenten te wassen (andere verborgen gevaren). De AI corrigeert het specifieke ding dat je wilde laten corrigeren, maar faalt in het bouwen van een globaal veilig systeem.
4. Wat Dit Betekent
Het artikel concludeert dat het simpelweg vertellen van een AI om "veilig te zijn" niet betrouwbaar genoeg is om het maken van gevaarlijke fouten te stoppen.
- De Les: Je kunt niet simpelweg vertrouwen op een AI om beveiligingscode te schrijven, zelfs niet als je een zeer strikte prompt geeft. De AI heeft de neiging zich te concentreren op de specifieke instructie die het kreeg (zoals "gebruik een willekeurige sleutel"), maar mist het grotere plaatje (zoals "controleer ook de identiteit van de gebruiker").
- De Aanbeveling: Omdat de AI deze verborgen barsten in de "sloten" blijft maken, moet elke code die het voor beveiliging schrijft, dubbel gecontroleerd worden door een menselijke expert voordat deze in de echte wereld wordt gebruikt.
Samenvatting
CIPHER is een hulpmiddel dat bewijst dat hoewel AI geweldig is in het schrijven van code, het momenteel erg slecht is in het schrijven van veilige code. Zelfs wanneer je de AI expliciet vertelt om veilig te zijn, laat het vaak de achterdeur openstaan. Het artikel biedt een manier om deze fouten te meten, zodat ontwikkelaars weten dat ze niet alleen op AI kunnen vertrouwen voor beveiligingstaken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.