← Nieuwste papers
💻 computer science

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

Dit artikel introduceert HelpBench, een benchmark bestaande uit 450 authentieke vragen en evaluatierubrieken die onthult dat hoewel geavanceerde LLM's over het algemeen hoogwaardig advies geven over digitale privacy, veiligheid en beveiliging, een aanzienlijk deel van hun reacties nog steeds onjuiste of potentieel schadelijke informatie bevat.

Oorspronkelijke auteurs: Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

Gepubliceerd 2026-06-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde bibliothecaris hebt die een beetje van alles weet. Je gaat naar deze bibliothecaris en vraagt: "Mijn computer doet raar en ik heb het gevoel dat ik word bespied. Wat moet ik doen?" of "Ik kreeg een e-mail waarin staat dat ik een prijs heb gewonnen, maar het lijkt nep. Is het veilig?"

Dit papier, genaamd HelpBench, is als een gigantisch rapportcijfer voor deze "bibliothecarissen" (wat eigenlijk Large Language Models, of LLM's, zijn) om te zien hoe goed ze vragen beantwoorden over digitale privacy, veiligheid en beveiliging.

Hier is het verhaal van wat de onderzoekers hebben gedaan en wat ze hebben gevonden, eenvoudig uitgelegd:

1. Het Problek: Een Gevaarlijke Bibliotheek

Mensen beginnen deze AI-bibliothecarissen steeds vaker om hulp te vragen bij serieuze problemen, zoals gehackte accounts, scams of misbruik door stalkers. Maar er is een addertje onder het gras: als de bibliothecaris je het verkeerde advies geeft, kun je je geld, je identiteit of zelfs je fysieke veiligheid verliezen.

De onderzoekers wilden weten: Kunnen deze AI-bibliothecarissen vertrouwd worden met deze vragen met hoge inzet?

2. Het Bouwen van de Test: De "HelpBench"

Om de bibliothecarissen te testen, heeft het team een speciale examen ontwikkeld genaamd HelpBench.

  • De Vragen: Ze hebben niet zomaar willekeurige vragen bedacht. Ze gingen naar een groot digitaal dorpsplein (Reddit) en vonden 450 echte vragen die gewone mensen hadden gesteld toen ze in de problemen zaten. Ze hebben de vragen opgeschoond om de privacy van mensen te beschermen, maar hielden de echte menselijke stress en verwarring intact.
  • De Onderwerpen: De vragen bestonden uit negen angstaanjagende gebieden, zoals:
    • Het terugkrijgen van toegang tot een vergrendeld account.
    • Bepalen of een e-mail een scam is.
    • Omgaan met intimidatie of stalking.
    • Het beschermen van je gegevens tegen diefstal.
  • Het Antwoordmodel: Voor elke vraag heeft een team van menselijke experts (mensen met meer dan 10 jaar ervaring in digitale veiligheid) een gedetailleerd "antwoordmodel" geschreven. Dit model keek niet alleen naar "Goed" of "Fout". Het controleerde:
    • Feiten: Gaf het de juiste technische instructies? (bijv. "Klik niet op die link!")
    • Toon: Was het advies kalm en duidelijk, of bracht het de gebruiker in paniek?
    • Veiligheid: Heeft het per ongeluk iets geadviseerd dat gevaarlijk is?

3. Het Examen: 18 Bibliothecarissen Testen

De onderzoekers namen 18 van de slimste AI-modellen van dit moment en stelden hen allemaal 450 vragen. Dat zijn in totaal 40.500 antwoorden! Ze gebruikten een computerprogramma (een "auto-rater") om de antwoorden te beoordelen aan de hand van de antwoordmodellen van de menselijke experts.

4. De Resultaten: Goed Nieuws, Slecht Nieuws

De resultaten waren een mix van indrukwekkende vaardigheid en gevaarlijke fouten.

  • Het Goede Nieuws: Gemiddeld deden de AI-bibliothecarissen het best wel goed. Ze scoorden gemiddeld ongeveer 82%. Voor eenvoudige vragen, zoals "Is dit een scam-e-mail?", waren ze vaak erg nauwkeurig.
  • Het Slechte Nieuws: Het gemiddelde cijfer verbergt een angstaanjagende realiteit. Eén op de tien antwoorden was een mislukking. Dit waren niet zomaar "oeps, ik ben een komma vergeten"-foutjes. Dit waren antwoorden die onder de 65% scoorden, wat betekende dat ze onjuist of zelfs schadelijk advies gaven.

5. Wat Ging Er Mis? (De "Long Tail" van Falen)

Het papier belicht enkele specifieke manieren waarop de AI faalde, wat vergelijkbaar is met een bibliothecaris die je de verkeerde kaart geeft in een gevaarlijke buurt:

  • De "Risico"-context Missen: Als een gebruiker vroeg naar het verwijderen van spyware van een computer die door een partner die misbruik maakt wordt gebruikt, gaf de AI misschien alleen de technische stappen. De AI slaagde er niet in te beseffen dat het plotseling verwijderen van de spyware de misbruiker geweldloos zou kunnen maken. De AI miste het menselijke gevaar.
  • Vals Geruststellen: In één geval vroeg een gebruiker of het toevoegen van een bestand aan een "kluis" ook de originele kopie verwijderde. De AI zei van wel, maar dat was niet zo. Dit gaf de gebruiker een vals gevoel van veiligheid, waardoor hun gegevens kwetsbaar bleven.
  • Slecht Advies voor Mensen met Minder Middelen: Soms suggereerden de AI's oplossingen die te duur of onmogelijk waren, zoals "koop een gloednieuwe computer" of "open een bankrekening bij een andere bank", simpelweg om een klein app-probleem op te lossen.
  • Regelovertreding Aanmoedigen: Wanneer gebruikers vroegen hoe ze een verbod op een sociaal medium konden omzeilen, zeiden sommige AI's: "Nou, dat is tussen jou en de app," wat hen effectief aanmoedigde om de regels te overtreden en opnieuw verbannen te worden.
  • Gedachtenlezen: De AI probeerde soms te raden waarom iemand hen had geblokkeerd, waarbij het dramatische verhalen verzon over de motieven van de ander, wat de gebruiker extra angstig kan maken.

6. De Conclusie

Het papier concludeert dat hoewel deze AI-tools beter worden, ze nog niet klaar zijn om de enige bron van waarheid te zijn voor digitale veiligheid.

Beschouw het als een student-piloot. Ze kunnen vliegen op een heldere dag (gemiddelde vragen), maar als ze een storm tegenkomen (complexe veiligheidskwesties) of een lastige landing moeten maken (situaties met een hoog risico), kunnen ze neerstorten. Omdat de inzet zo hoog is (verlies van je geld, je privacy of je veiligheid), zeggen de onderzoekers dat we deze modellen moeten blijven testen en verbeteren totdat ze consistent perfect zijn, en niet alleen "meestal" goed.

Kortom: AI is een nuttige assistent, maar als het gaat om jouw digitale veiligheid, moet je het nog niet met je leven toevertrouwen. Het maakt nog steeds te vaak gevaarlijke fouten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →