Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading
Dit artikel betoogt dat huidige evaluatiekaders voor grote taalmodellen die vertrouwen op statische prompts misleidend zijn, omdat promptoptimalisatie de modelrangschikkingen aanzienlijk verandert, wat per-model promptoptimalisatie vereist om het beste model voor een specifieke taak nauwkeurig te identificeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De Valstrik van "Eén Maat Past Allen"
Stel je voor dat je een personeelsverantwoordelijke bent die de beste kok voor je restaurant zoekt. Je hebt vijf verschillende koks (laten we ze Model A, B, C, D en E noemen). Om ze te testen, geef je ze allemaal exact hetzelfde receptkaartje: "Maak een stoofpot. Gebruik zout, peper en uien."
Je ziet ze koken, proeft de stoofpot en rangschikt ze. Kok B wint. Je huurt Kok B in.
Het probleem: Kok B is geweldig in het volgen van dat specifieke recept, maar misschien is Kok D eigenlijk een genie die alleen een iets anders geformuleerd recept nodig heeft om te schitteren. Misschien moet Kok D de instructie krijgen: "Bak de uien eerst, voeg dan het zout toe," om zijn beste werk te leveren.
Dit paper stelt dat de huidige manieren om AI-modellen (Large Language Models) te testen, lijken op die personeelsverantwoordelijke. Ze geven elke AI exact hetzelfde statische prompt (het receptkaartje) en rangschikken ze op basis van wie het beste presteert met dat specifieke kaartje.
De auteurs zeggen dat dit misleidend is. In de echte wereld, als je een AI inhuurt, zou je niet zomaar een generiek prompt geven; je zou de instructies aanpassen om de beste prestatie uit die specifieke AI te halen. Dit paper noemt dat proces Prompt Optimalisatie (PO).
Het Experiment: Pas het Recept Aan, Verander de Winnaar
De onderzoekers namen vijf populaire AI-modellen en testten ze op verschillende taken (zoals het oplossen van wiskundeproblemen, het beantwoorden van zakelijke vragen of het extraheren van data).
- Ronde 1 (De Oude Manier): Ze gaven elk model hetzelfde "basis" prompt. Ze rangschikten ze.
- Ronde 2 (De Nieuwe Manier): Ze gebruikten een geautomatiseerd hulpmiddel om het prompt voor elk model individueel te "tunen". Ze vroegen de AI: "Hoe kunnen we de instructies herschrijven zodat jij ze het beste begrijpt?" en draaiden vervolgens de tests opnieuw.
Het Resultaat: De rangschikkingen veranderden volledig.
- In sommige gevallen sprong het model dat in Ronde 1 op de laatste plaats eindigde, naar de eerste plaats in Ronde 2.
- Het model dat "beste" was in de oude test, was niet noodzakelijk het beste wanneer het instructies kreeg die op maat waren gemaakt voor zijn specifieke brein.
De Analogie: Het is alsof je hardlopers test op een baan.
- Oude Methode: Je laat iedereen rennen in zware laarzen. Hardloper A wint omdat ze gewend is aan zware laarzen.
- Nieuwe Methode: Je geeft Hardloper A lichte sportschoenen en Hardloper B op maat gemaakte steunzolen. Plotseling wint Hardloper B.
- Conclusie: Als je ze alleen had getest in zware laarzen, had je de verkeerde hardloper ingehuurd voor een marathon.
Belangrijkste Leerpunten uit de Studie
1. De "Beste" Model Hangt Af van het Prompt
Het paper vond dat de "winnaar" van een wedstrijd verandert afhankelijk van hoe de instructies zijn geschreven. Als je de beste AI wilt kiezen voor een specifieke baan, moet je eerst de instructies optimaliseren voor die specifieke AI. Als je dat niet doet, kun je een model kiezen dat voor jouw behoeften eigenlijk gemiddeld is.
2. Verschillende Modellen Reageren Verschillend
Net als mensen hebben verschillende AI's verschillende "persoonlijkheden" of gevoeligheid.
- Sommige modellen (zoals Model B in de studie) waren zeer gevoelig voor prompt-wijzigingen. Een kleine aanpassing zorgde ervoor dat ze veel beter presteerden.
- Andere modellen waren al zo goed in een specifieke taak (zoals eenvoudig routeren) dat het aanpassen van het prompt hen niet veel hielp, of hen soms zelfs verwarde.
3. De "Criticus" Kan Verward Raakken
De onderzoekers gebruikten een "criticus"-AI (GPT-4o) om de prompts voor de andere modellen te herschrijven. Meestal werkte dit uitstekend. Soms werd de criticus echter te slim of werden de instructies te complex, waardoor het model faalde.
- Voorbeeld: In één geval vertelde het geoptimaliseerde prompt de AI om "stap voor stap na te denken", zodat het begon met het beantwoorden van de voorbeeldvragen in het prompt in plaats van de daadwerkelijke testvraag. Het was alsof een student de antwoorden van de oefentoets hardop voorlas in plaats van het examen te maken.
Wat Dit Voor Jou Betekent (De Praktijk)
Als je een bedrijf bent dat probeert een AI te kiezen om een baan te doen (zoals het beantwoorden van klantmails of het analyseren van documenten), voer dan niet zomaar een standaard benchmark uit.
Het paper concludeert dat je, om het ware beste model voor je specifieke taak te vinden, het volgende moet doen:
- Neem je taak.
- Probeer verschillende modellen.
- Optimaliseer het prompt voor elk model individueel om te zien waar ze werkelijk toe in staat zijn.
- Kies vervolgens de winnaar.
Als je stap 3 overslaat en gewoon een generiek prompt gebruikt, maak je waarschijnlijk een slechte inhuurbeslissing op basis van een mislende test.
Samenvatting
Het paper is een waarschuwing: Beoordeel een vis niet op zijn vermogen om een boom te beklimmen, en beoordeel een AI niet op zijn vermogen om een generiek prompt te volgen. Om te weten wie werkelijk de beste is, moet je hun taal spreken. Als je het prompt niet optimaliseert voor elk model, zijn je evaluatieresultaten waarschijnlijk verkeerd, en kun je eindigen met het verkeerde gereedschap voor de klus.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.