Token Is All You Price
Dit artikel toont aan dat de prijsstelling van token-gebaseerde AI-diensten (zoals abonnementen en API-tiers) de optimale manier is voor aanbieders om winst te maximaliseren door de urgentie van verschillende gebruikers te screenen via limieten op het aantal tokens.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je in een drukke stad woont en altijd honger hebt. Er is één superpopulaire snackbar die de allerbeste burgers ter wereld maakt, maar ze hebben een probleem: de keuken is klein en de kok kan maar een beperkt aantal ingrediënten per uur verwerken. Ze kunnen dus niet iedereen tegelijkertijd de allerbeste ervaring geven.
Dit paper, geschreven door Weijie Zhong, legt uit hoe die snackbar (of in de echte wereld: een AI-bedrijf zoals OpenAI of Anthropic) de slimste manier vindt om prijzen te vragen aan klanten die allemaal een ander tempo hebben.
Hier is de uitleg in begrijpelijke taal:
1. De kern: "Hoe snel heb je je antwoord nodig?"
In de wereld van AI (zoals ChatGPT) zijn er twee soorten gebruikers:
- De 'Haastige Klant': De student die over vijf minuten een deadline heeft voor een essay. Die wil nu antwoord, ook al is het duur.
- De 'Geduldige Klant': De onderzoeker die een artikel schrijft en het niet erg vindt als de AI er een kwartiertje over doet om een diepgaand antwoord te formuleren.
Het probleem voor de AI-verkoper is: hoe weet je wie wie is zonder dat mensen gaan liegen om de goedkoopste prijs te krijgen?
2. De oplossing: De "Stoplicht-methode" (De Token-Cap)
Vroeger dachten economen dat een verkoper de kwaliteit van het product zou verlagen om verschillende klanten te scheiden (bijvoorbeeld: een snelle, slechte burger voor de haastige klant en een langzame, luxe burger voor de rijke klant).
Maar dit paper zegt iets heel verrassends: De beste AI-bedrijven veranderen de kwaliteit van hun 'brein' niet. Ze veranderen alleen de tijdslimiet.
Stel je voor dat de AI een magische bibliothecaris is die boeken voor je zoekt. In plaats van de bibliothecaris dommer te maken voor de goedkope klanten, zegt de verkoper simpelweg:
- Premium abonnement: "Je mag de bibliothecaris zolang laten zoeken als je wilt."
- Goedkoop abonnement: "Je mag de bibliothecaris maar 5 minuten laten zoeken. Daarna moet hij stoppen, ook al is hij nog niet klaar."
Dit noemen we in het paper een "stopping-time cap". Je betaalt niet voor een 'dommer' model, je betaalt voor de tijd die het model krijgt om na te denken.
3. De Metafoor: De "Gouden Stroom"
Denk aan de informatie die de AI geeft als een gouden stroom die uit een kraan komt. De kraan kan maar een bepaalde hoeveelheid goud per minuut leveren (dat is de throughput constraint).
De slimste manier om die kraan te gebruiken is de "Greedy Exploration" (de gulzige methode). De AI probeert niet om een beetje van alles te vertellen, maar probeert zo snel mogelijk de kern van de waarheid te raken. Het is als een detective die niet eerst de hele stad doorzoekt, maar direct naar de meest verdachte huizen rent om de dader te vinden.
De verkoper verkoopt vervolgens "bakjes" van deze gouden stroom:
- De rijke klant krijgt een groot bakje (veel tijd/tokens).
- De arme klant krijgt een klein bakje (weinig tijd/tokens).
4. Waarom is dit belangrijk? (De "Aha!"-ervaring)
Dit verklaart waarom AI-bedrijven werken met "tokens" en "quota".
Als je ziet dat ChatGPT zegt: "Je hebt nog 10 berichten over voor de komende 3 uur", dan zie je precies wat dit paper beschrijft. Ze verkopen je niet een minder slimme AI; ze verkopen je een tijdsbeperking.
De conclusie van het paper in één zin:
De slimste manier om winst te maken met AI is om één superintelligent model te hebben dat altijd zijn best doet, maar de klanten te laten betalen voor de hoeveelheid "denktijd" die ze mogen gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.