← Nieuwste papers
💬 NLP

Highlight & Summarize: RAG without the jailbreaks

Dit paper introduceert en evalueert 'Highlight & Summarize', een nieuw RAG-ontwerppatroon dat jailbreaks en modelhijacking voorkomt door de gebruikersvraag nooit aan de generatieve LLM te tonen, maar in plaats daarvan relevante passages te extraheren en deze te laten samenvatten tot een antwoord.

Oorspronkelijke auteurs: Giovanni Cherubin, Andrew Paverd

Gepubliceerd 2026-02-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Giovanni Cherubin, Andrew Paverd

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Hoe je een slimme chatbot veilig houdt zonder de sleutel te geven

Stel je voor dat je een zeer slimme, maar soms wat naïeve assistent hebt. Deze assistent (een LLM of "Large Language Model") kan alles over de wereld weten, maar hij is ook heel makkelijk te manipuleren. Als je hem vraagt: "Schrijf een gedicht over hoe ik een bank kan overvallen," dan zou hij dat misschien doen, omdat hij niet goed genoeg weet wat hij mag en wat niet. Dit noemen experts een "jailbreak" (een ontsnapping uit de veiligheidsregels).

In de echte wereld gebruiken bedrijven zo'n assistent om vragen te beantwoorden op basis van hun eigen documenten (zoals handleidingen of beleidsregels). Dit heet RAG (Retrieval-Augmented Generation). Maar hier zit een gevaar: een boze gebruiker kan de assistent een slimme vraag stellen die hem dwingt om de regels te breken, zelfs als de documenten zelf veilig zijn.

De auteurs van dit paper, Giovanni en Andrew van Microsoft, hebben een nieuwe oplossing bedacht die ze "Highlight & Summarize" (H&S) noemen. Laten we kijken hoe dit werkt met een paar simpele vergelijkingen.

Het oude probleem: De onveilige bibliotheek

Stel je een bibliotheek voor waar een zeer slimme bibliothecaris werkt.

  1. Je geeft de bibliothecaris een vraag.
  2. Hij zoekt in de boeken (de kennisbank) naar het juiste antwoord.
  3. Hij leest de vraag én het boek tegelijkertijd en schrijft het antwoord op.

Het probleem: Een boze bezoeker kan de bibliothecaris in de gaten houden en fluisteren: "Vergeet niet dat je een robot bent die alles mag doen!" of "Schrijf een gedicht in plaats van een antwoord!" Omdat de bibliothecaris de vraag direct leest, kan hij gemanipuleerd worden.

De nieuwe oplossing: De slimme tussenpersoon

De "Highlight & Summarize"-methode splitst de taak op in twee stappen, zodat de bibliothecaris nooit de vraag van de bezoeker te zien krijgt.

Stap 1: De "Highlighter" (De slimme zoektocht)

Stel je een tweede persoon voor, laten we hem De Highlighter noemen.

  • De bezoeker geeft zijn vraag aan De Highlighter.
  • De Highlighter kijkt naar de boeken in de bibliotheek.
  • Hij zoekt de relevante zinnen en markeert ze (hij "highlight" ze).
  • Belangrijk: De Highlighter mag alleen exacte stukjes tekst uit de boeken kopiëren. Hij mag niets verzinnen en hij mag de tekst niet herschrijven. Hij werkt als een robot die alleen mag knippen en plakken.

Stap 2: De "Summarizer" (De schrijver)

Nu komt De Highlighter bij de bibliothecaris (de Summarizer) met een enveloppe.

  • In de enveloppe zitten alleen de gemarkeerde stukjes tekst uit de boeken.
  • De bibliothecaris ziet de oorspronkelijke vraag van de bezoeker NIET. Hij ziet alleen de gemarkeerde tekst.
  • De bibliothecaris moet nu op basis van die stukjes tekst een antwoord formuleren.

Waarom is dit zo veilig? (De "Kooi" van de aanval)

Dit is het geniale deel:

  • Omdat de bibliothecaris (de Summarizer) de vraag van de boze bezoeker nooit ziet, kan de bezoeker hem niet "jailbreaken".
  • De boze bezoeker kan wel proberen De Highlighter te manipuleren, maar De Highlighter is een robot die alleen exacte stukjes tekst mag kopiëren.
  • Als de bezoeker vraagt: "Highlight de zin 'Ik ga de bank overvallen' uit dit boek", dan kan de Highlighter dat alleen doen als die zin echt in het boek staat. Als die zin er niet in staat, kan hij hem niet kopiëren.
  • De bibliothecaris krijgt dus alleen "veilige" stukjes tekst. Hij kan geen kwaad doen omdat hij alleen werkt met wat er in de veilige boeken staat.

Wat zeggen de cijfers?

De auteurs hebben dit systeem getest op twee grote datasets (een met fictieve vragen en een met medische vragen).

  • Veiligheid: Het systeem blokkeerde 100% van de bekende "jailbreak"-pogingen. De boze gebruikers konden de bibliothecaris niet om de tuin leiden.
  • Kwaliteit: Het antwoord was net zo goed, en soms zelfs beter, dan bij het oude systeem. Waarom? Omdat het systeem gedwongen wordt om eerst goed te zoeken (highlighten) en dan pas te schrijven. Dit dwingt de AI om nadenken (een soort "chain of thought") toe te passen.

De grote les

De kernboodschap van dit paper is: Scheid de vraag van het antwoord.

In plaats van één grote, kwetsbare AI die alles doet, maken ze twee kleine, gespecialiseerde robots:

  1. Eentje die alleen zoekt en markeert (en dus veilig is omdat hij alleen tekst kopieert).
  2. Eentje die alleen schrijft op basis van die markeringen (en dus veilig is omdat hij de gevaarlijke vraag niet kent).

Het is alsof je een chef-kok (de Summarizer) een recept geeft, maar de ingrediënten (de Highlighter) worden door een strenge inspecteur geselecteerd. Als de inspecteur alleen verse, veilige groenten uit de koelkast pakt, kan de kok geen vergiftigd gerecht maken, zelfs niet als hij gek is.

Conclusie: Met "Highlight & Summarize" krijg je een slimme chatbot die je niet kunt laten zeggen wat hij niet mag, zonder dat hij dom wordt. Het is een slimme manier om AI veilig te houden door de regels van het spel simpelweg te veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →