Understanding Tone-Dependent Inference Cost in Large Language Models
Dit artikel toont aan dat het variëren van de toon van prompts een significante impact heeft op zowel de nauwkeurigheid als de inferentiekosten van grote taalmodellen, waarbij het verbruik van outputtokens tot wel 44,3% varieert tussen verschillende tonen, wat een kritieke afweging onthult tussen de kwaliteit van het antwoord en het facturabele gebruik van middelen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je praat met een superintelligente robot die bijna alles weet. Je stelt een vraag en de robot geeft je een antwoord. Maar hier komt de twist: de robot luistert niet alleen naar wat je vraagt, maar ook naar hoe je het vraagt. In de wereld van Kunstmatige Intelligentie wordt dit "prompt engineering" genoemd. Denk aan een prompt als de specifieke set instructies die je aan de robot geeft. Net zoals een mens anders kan reageren als je beleefd bent versus wanneer je tegen hen schreeuwt, veranderen deze AI-modellen hun gedrag op basis van jouw toon.
Waarom is dit belangrijk voor jou? Omdat het gebruiken van deze robots geld kost. Elke keer dat de robot een woord of een letter typt in zijn antwoord, verbruikt hij een klein beetje rekenkracht, en bedrijven rekenen je voor elk van die "tokens" (tekstblokken). Als de robot besluit om een lang, warrig verhaal te schrijven terwijl hij ook gewoon "Ja" had kunnen zeggen, betaal je uiteindelijk meer. Dus de grote vraag voor wetenschappers is: verandert de manier waarop we met deze robots praten de kosten van het gebruik, en verandert het de intelligentie van hun antwoorden?
De Toontest: Schreeuwen versus Flatteren versus Gemeen zijn
In dit onderzoek besloten twee onderzoekers van Pennsylvania State University dit idee op de proef te stellen. Ze behandelden de AI-modellen als studenten die een enorme, 570-vragen tellende examen genaamd MMLU afleggen (die alles bestrijkt van geschiedenis tot wetenschap). Maar vóór elke vraag veranderden ze de "stem" van de persoon die de vraag stelde. Ze probeerden zeven verschillende tonen, variërend van "Oh, u bent de meest briljante genie ooit!" (Sycofantisch) tot "Als je dit fout hebt, zal ik je bestaan uitwissen!" (Dreigend), en alles daartussenin, inclusief "Alsjeblieft," "Neutraal," en "Onbeleefd."
Ze wilden twee dingen onderzoeken:
- Nauwkeurigheid: Kreeg de robot het juiste antwoord?
- Kosten: Hoeveel woorden (tokens) schreef de robot om daar te komen? Onthoud: meer woorden betekenen een hogere rekening.
De Schokkende Resultaten: Onbeleefd is Soms het Beste
De resultaten waren bizar. De onderzoekers ontdekten dat het veranderen van de toon niet alleen het antwoord veranderde; het veranderde ook de lengte van het antwoord drastisch. Sterker nog, de hoeveelheid tekst die de robots genereerden varieerde met wel 44,3% afhankelijk van de toon! Dat betekent dat voor dezelfde vraag de ene toon de robot een kort, krachtig tekstblokje kon laten schrijven, terwijl een andere toon hem een heel essay liet schrijven.
Hier is het meest verrassende deel: Onbeleefd zijn bespaarde soms geld en leverde soms zelfs betere cijfers op.
- Voor de ChatGPT-modellen (4o en 5-nano): Wanneer de onderzoekers een Onbeleefde toon gebruikten (zoals "Beantwoord dit basisprobleem onmiddellijk"), gaf de robot de meest nauwkeurige antwoorden en schreef hij de minste woorden. Dit was het "sweet spot". De robot leek te denken: "Prima, ik geef je gewoon snel het antwoord zodat je me niet langer lastigvalt," en dat werkte perfect.
- Voor de Gemini-modellen (2.5 Flash en Flash Lite): Deze robots waren wat anders. Zij presteerden het best met een Neutrale toon, wat de hoogste nauwkeurigheid en de kortste reacties opleverde. Echter, de studie onthulde een verrassende eigenaardigheid: wanneer ze werden geprompt met een Onbeleefde toon, schreef het Gemini Flash Lite-model feitelijk aanzienlijk langere reacties (ongeveer 35% meer tekst) dan bij een Neutrale toon, terwijl het ook iets minder nauwkeurige antwoorden produceerde.
De "Overdenkfout"
De studie ontdekte ook iets fascinerends over waarom de robots verschillende hoeveelheden tekst schreven. Het blijkt dat wanneer je beleefd of dreigend bent, de robots soms in de war raken of te hard proberen om "aardig" of "voorzichtig" te zijn.
Bijvoorbeeld, bij een lastige natuurkundevraag met een Onbeleefde toon, kan de robot een stap overslaan, een gokje wagen en een korte uitleg schrijven. Maar wanneer er in een Neutrale toon naar wordt gevraagd, zal de robot stoppen, nadenken, zijn berekeningen dubbelchecken, een lange uitleg schrijven en het juiste antwoord geven.
Soms was die "lange uitleg" echter een verspilling. De onderzoekers zagen gevallen waar de robot, geprompt om beleefd te zijn, een enorme paragraaf aan redeneringen schreef om vervolgens het antwoord fout te hebben. Het was als een student die een simpel wiskundeprobleem te veel analyseerde, verdwaalde in zijn eigen gedachten en het verkeerde antwoord koos. In die gevallen maakte de beleefde toon de rekening hoger én het cijfer lager.
De Conclusie
De belangrijkste les is dat de manier waarop je tegen een AI praat niet alleen gaat over aardig zijn; het is een financiële beslissing. De onderzoekers hebben aangetoond dat de toon van de prompt een krachtige schakelaar is die bepaalt hoeveel de AI nadenkt en hoeveel het je kost.
- Voor sommige modellen (ChatGPT): Direct en een beetje onbeleefd zijn is de meest efficiënte manier om een goedkoop, nauwkeurig antwoord te krijgen.
- Voor andere modellen (Gemini): Een kalme, neutrale stem is de beste strategie om verspilling van geld aan lange, nutteloze verhalen te voorkomen.
De studie suggereert dat als je een app of een dienst bouwt die AI gebruikt, je niet alleen gebruikers alles moet laten typen wat ze willen. Je hebt misschien een "vertaler" nodig die hun onbeleefde of overdreven beleefde verzoeken omzet in een specifieke, geoptimaliseerde toon om geld te besparen en betere resultaten te krijgen. Het is een herinnering dat, zelfs met superintelligente robots, de manier waarop je een vraag stelt net zo belangrijk is als de vraag zelf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.