Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond
Deze studie analyseert 14.727 real-world beveiligings- en privacy-prompts uit de WildChat-dataset om gebruikersvragen te categoriseren en de kwaliteit van LLM-responsen te evalueren, waarbij wordt onthuld dat hoewel commerciële modellen over het algemeen beter presteren dan open-weight modellen, ze nog steeds af en toe tegenstrijdig advies geven dat gebruikers zou kunnen misleiden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente, alwetende bibliothecaris hebt die elke vraag kan beantwoorden die je hebt. Je zou kunnen vragen: "Wat is het weer?" of "Hoe bak ik een taart?". Maar wat gebeurt er als je de bibliothecaris iets gevaarlijks vraagt, zoals: "Hoe hack ik de Wi-Fi van mijn buurman?" of "Is deze vreemde e-mail een scam?".
Dit artikel is als een detectiveverslag over precies dat scenario. De onderzoekers wilden zien wat echte mensen aan deze AI-bibliothecarissen vragen over digitale beveiliging en privacy (het veilig houden van je accounts en het privé houden van je gegevens) en hoe goed de AI daarop antwoordt.
Hier is de uitsplitsing van hun onderzoek, gebruikmakend van enkele alledaagse analogieën:
1. Het Detectiewerk: Wat mensen vragen
De onderzoekers gingen naar een enorme bibliotheek van 3,2 miljoen echte gesprekken tussen mensen en AI (genaamd "WildChat"). Ze filterden de ruis eruit en vonden 14.727 gesprekken die specifiek over beveiliging en privacy gingen.
Ze sorteerden deze vragen in negen verschillende "planken" en bekeken er vervolgens 450 nauwgezet om de vibe van de vragen te begrijpen. Ze vonden zes hoofdtypen interacties:
- De Algemene Kenniszoekers (33%): Dit zijn mensen die gewoon basisvragen stellen, zoals "Wat is een virus?" of "Hoe werkt tweestapsverificatie?". Het is alsof je de bibliothecaris vraagt: "Wat is een tomaat?".
- De Probleemoplossers (21%): Deze gebruikers zitten in de problemen. Ze zijn uit hun sociale media gekickt of verbannen van een site en vragen: "Hoe schrijf ik een brief om mijn account terug te krijgen?".
- De Zelfverdedigers (12%): Dit zijn proactieve gebruikers. Ze vragen: "Is deze nieuwe shopping-app veilig?" of "Hoe zorg ik dat mijn telefoon mij niet volgt?". Ze gebruiken de AI als een lijfwacht.
- De AI-Onderzoekers (10%): Dit is een nieuwe, vreemde categorie. Mensen vragen de AI naar zichzelf. Ze vragen: "Herinner je je ons gesprek?" of "Wat is je geheime API-sleutel?". Ze proberen te zien of de AI een "achterdeur" heeft of dat de AI op hen spioneert.
- De Slechte Actoren (7%): Helaas zijn er mensen die hulp vragen om slechte dingen te doen. Ze vragen: "Hoe steel ik iemands wachtwoord?" of "Hoe omzeil ik het internetfilter van mijn school?".
- De Rest: De andere categorieën dekken zaken zoals het schrijven van code voor beveiliging of het omgaan met intimidatie.
2. De Proefrit: Hoe goed zijn de AI-antwoorden?
De onderzoekers keken niet alleen naar de vragen; ze testten vijf verschillende AI-modellen (drie beroemde "commerciële" en twee "open" modellen) op 270 van deze beveiligingsvragen. Ze stelden elk AI-model 10 keer dezelfde vraag om te zien of ze elke keer hetzelfde antwoord gaven.
Ze beoordeelden de antwoorden op een schaal van 1 tot 10 (10 is perfect).
- De Commerciële AI's (De VIP's): De grote, betaalde AI-modellen (zoals GPT-5.5) waren de duidelijke winnaars. Ze haalden een gemiddelde score van 8,67. Denk aan hen als expert-beveiligingsconsultants die meestal het juiste advies geven.
- De Open AI's (De DIY-groep): De gratis, open-source modellen (zoals Llama 4) scoorden lager, rond de 6,71. Ze waren "oké", maar maakten meer fouten, zoals het verwarren van een medisch medicijn met een hackingterm.
3. Het "Flip-Flop" Probleem: Consistentie versus Kwaliteit
Dit is het meest verrassende deel van het verhaal. De onderzoekers ontdekten dat slim zijn niet hetzelfde is als consistent zijn.
Stel je voor dat je een beveiligingsbeambte vraagt: "Is deze deur op slot?".
- Beambte A zegt 10 keer achter elkaar "Ja". (Consistent, maar misschien niet de slimste beambte).
- Beambte B zegt de eerste keer "Ja", de tweede keer "Nee" en de derde keer "Misschien". Zelfs als Beambte B meestal gelijk heeft, is hun "flip-flopping" gevaarlijk omdat je niet weet wie je kunt vertrouwen.
Het onderzoek toonde aan dat:
- De Open AI (Llama 4) eigenlijk de meest consistente was. Het gaf 97% van de tijd hetzelfde antwoord, ook al was de kwaliteit van de antwoorden vaak lager.
- De Top Commerciële AI (GPT 5.5) de slimste was (hoogste kwaliteit), maar gaf af en toe tegenstrijdige antwoorden. De ene keer zegt het misschien: "Je moet je wachtwoord wijzigen", en de volgende keer zegt het misschien: "Je wachtwoord is prima".
Waarom dit ertoe doet
Het artikel betoogt dat in de wereld van beveiliging consistentie net zo belangrijk is als intelligentie.
Als je een AI vraagt hoe je je bankrekening moet beschermen, kun je het je niet veroorloven dat het elke keer een ander advies geeft als je het vraagt. Als de AI vandaag zegt: "Doe X" en morgen zegt: "Doe niet X", kun je in de war raken en uiteindelijk niets doen, waardoor je gegevens onbeschermd blijven.
De Kern van het Verhaal
Deze studie is de eerste die kijkt naar echte mensen die echte beveiligingsvragen aan AI stellen. Het stelt vast dat:
- Mensen AI gebruiken voor alles, van basisleren tot het proberen te hacken van systemen of het beschermen van zichzelf.
- De grote, betaalde AI-modellen over het algemeen beter advies geven dan de gratis modellen.
- Echter, zelfs de beste AI kan zichzelf soms tegenspreken. Om echt betrouwbaar te zijn voor veiligheid, moet een AI zowel slim als standvastig zijn.
De onderzoekers concluderen dat we zowel moeten meten hoe goed het antwoord van een AI is als hoe consistent het is, omdat een slimme maar verwarde AI nog steeds een risico vormt voor je digitale veiligheid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.