Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach
Dit artikel presenteert een empirische studie die aantoont dat geoptimaliseerde prompt-engineeringtechnieken de prestaties van Small Language Models in multi-hop RAG-taken aanzienlijk kunnen verbeteren, met tot wel 84,5% stijging op de HotpotQA-dataset.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een kleine, slimme assistent hebt (een "Small Language Model" of SLM). Deze assistent is geweldig in het beantwoorden van simpele vragen, maar als je hem een complexe vraag stelt die informatie uit verschillende boeken vereist, raakt hij in de war. Hij probeert het uit zijn hoofd te weten, maar hij vergeet snel of hij verzonnen feiten (hallucinaties) bedenkt.
Om dit op te lossen, geven we de assistent een bibliotheek bij de hand. Dit noemen we RAG (Retrieval Augmented Generation). De assistent zoekt in de bibliotheek naar de juiste pagina's en leest ze voor het antwoord.
Maar hier komt het probleem: Hoe geef je de instructie?
Als je de assistent alleen zegt: "Lees dit en geef een antwoord", doet hij het vaak slecht. Hij weet niet precies hoe hij moet denken.
Deze paper is een groot experiment om uit te vinden: Wat is de beste manier om de assistent te vertellen hoe hij moet denken?
De Grote Proef: 24 Manieren om te Vragen
De onderzoekers (van de Universiteit van Isfahan) hebben 24 verschillende "vraagformuleringen" (prompten) getest. Ze hebben dit gedaan op twee populaire, kleine assistenten: Qwen en Gemma.
Ze hebben een moeilijke test gebruikt genaamd HotpotQA. Dit zijn vragen die je niet in één zin kunt beantwoorden. Je moet bijvoorbeeld eerst weten wie de winnaar van de Olympische Spelen van 2004 was, en dan pas weten welk land die persoon vertegenwoordigde. Je moet twee feiten aan elkaar knopen.
De 24 manieren werden ingedeeld in drie groepen:
- De Standaard: "Hier is de tekst, geef antwoord." (De basis).
- De Bekende Trucs: Bestaande methoden uit de wetenschap, zoals "Denk stap voor stap" (Chain of Thought).
- De Nieuwe Hybriden: De onderzoekers hebben 14 nieuwe, slimme combinaties bedacht.
Wat Vonden Ze? (De Resultaten in Gewone Taal)
1. De "Snelheid vs. Nauwkeurigheid" Afweging
Stel je voor dat je een pakketje moet bezorgen.
- De Snelle Koerier (Standaard prompt): Deze rijdt hard, is snel, maar maakt soms fouten omdat hij niet goed kijkt.
- De Gedetailleerde Detective (Nieuwe hybride prompts): Deze neemt de tijd. Hij checkt elke aanwijzing, maakt een lijstje, en denkt na over elke stap. Hij is veel nauwkeuriger, maar hij duurt 8 tot 10 keer langer.
De paper laat zien dat als je de assistent dwingt om als een detective te denken (stap-voor-stap), hij veel minder fouten maakt. Maar je moet wel geduld hebben.
2. Niet elke assistent is hetzelfde
Dit is een heel belangrijk punt. Wat werkt voor de ene assistent, werkt niet voor de andere.
- Qwen (de 3B model): Deze heeft meer "hand-holding" nodig. Hij moet heel duidelijk worden verteld: "Eerst doe je dit, dan dat, en controleer het daarna." Als je hem dit zegt, wordt hij heel slim, maar hij is traag.
- Gemma (de 4B model): Deze is iets slimmer en heeft een ander brein. Voor deze assistent werkt een nieuwe, slimme prompt (genaamd expert_synthesis) wonderbaarlijk goed. Deze prompt zegt eigenlijk: "Je bent een expert, vat alles samen en geef het beste antwoord."
- Het verrassende resultaat: Gemma was met deze prompt sneller én nauwkeuriger dan met de lange, stap-voor-stap instructies. Het bleek dat deze assistent het "stap-voor-stap" gedoe niet nodig had; hij kon het zelf in zijn hoofd doen als je hem maar de juiste rol gaf.
3. De "LLM als Rechter"
Hoe wisten ze of het antwoord goed was? Ze lieten een nog slimmere AI (GPT-4o-mini) de antwoorden beoordelen.
Stel je voor dat een simpele computer telt of woorden overeenkomen (zoals RAGAS deed). Dat werkt niet goed, want een goed antwoord kan anders geformuleerd zijn dan het voorbeeld.
De onderzoekers lieten daarom een slimme rechter kijken naar:
- Is het antwoord logisch?
- Zijn de feiten waar?
- Is het antwoord compleet?
Dit gaf een veel eerlijker beeld van de prestaties.
De Grote Les voor de Praktijk
De paper geeft een soort menukaart voor wie een slimme, kleine AI wil bouwen:
- Wil je het allerbeste antwoord, en maakt snelheid niet uit? (Bijvoorbeeld voor medische diagnoses of juridisch advies)
- Gebruik: De nieuwe, complexe "hybride" prompts. Laat de AI als een detective werken.
- Wil je een snelle chatbot voor op je telefoon? (Bijvoorbeeld voor een klantenservice)
- Gebruik: De simpele, korte instructies. De AI is dan minder slim, maar wel supersnel.
- Heb je een iets slimmere AI (zoals Gemma)?
- Gebruik: De "Expert Synthesis" prompt. Dit is de "heilige graal": het geeft een topantwoord, maar is ook nog redelijk snel.
Conclusie
Deze paper zegt eigenlijk: "Er is geen één perfecte manier om een AI te vragen."
Het hangt af van wat je AI precies is (het model) en wat je nodig hebt (snelheid of precisie). Door slimme instructies te geven, kun je kleine, goedkope AI's laten presteren als grote, dure systemen, maar je moet wel weten welke "taal" je tegen welke AI moet spreken.
Kortom: Geef je assistent de juiste rol en de juiste instructies, en hij kan wonderen verrichten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.