← Nieuwste papers
🤖 machine learning

Contextual Scalarisation Thompson Sampling for multi-objective decisions in public media

Dit artikel introduceert Contextual Scalarisation Thompson Sampling (CSTS), een multi-objective contextual bandit-algoritme dat dynamisch leert om concurrerende redactionele doelstellingen op basis van context te wegen, waarbij verbeterde relevantie en afstemming op expertcuratie wordt aangetoond op echte gegevens van de Zwitserse nationale omroep.

Oorspronkelijke auteurs: Théo Maëtz, Luc Guillet, Andrea Cavallaro

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Théo Maëtz, Luc Guillet, Andrea Cavallaro

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de chef-kok bent van een zeer bekend, door de overheid gefinancierd restaurant. Je taak is niet alleen om het populairste gerecht van de dag te serveren; je hebt een complexe missie. Je moet ervoor zorgen dat:

  • Het restaurant vol zit: Je hebt genoeg klanten nodig (Publiek).
  • De menukaart divers is: Je kunt niet elke avond pizza serveren; je hebt variatie nodig voor verschillende smaken (Diversiteit).
  • Je nieuwe dingen probeert: Je moet af en toe verse ingrediënten introduceren (Nieuwigheid).
  • Je niet aangeklaagd wordt: Je moet je houden aan strikte contracten over welke ingrediënten je mag gebruiken en wanneer ze verlopen (Rechten).
  • Je de concurrentie verslaat: Als het restaurant naast je een enorme biefstuk serveert, moet jij misschien iets anders serveren om op te vallen (Concurrentie).

In het verleden moesten de chefs (curatoren) bij deze publieke omroep, Radio Télévision Suisse (RTS), deze beslissingen handmatig nemen. Ze keken naar duizenden films en probeerden al die concurrerende doelen in hun hoofd in balans te brengen. Dat was moeilijk, traag en hing volledig af van hun persoonlijke ervaring.

Het artikel introduceert een nieuwe "slimme assistent" genaamd CSTS (Contextual Scalarisation Thompson Sampler) om hen te helpen. Hier is hoe het werkt, eenvoudig uitgelegd:

1. Het probleem met "één maat voor iedereen"

De meeste aanbevelingssystemen (zoals Netflix of Spotify) kiezen meestal één doel: "Wat krijgt de meeste clicks?" of "Wat is het populairst?".

Sommige systemen proberen doelen te balanceren, maar gebruiken vaste regels. Stel je een chef voor die besluit: "Ik zal altijd nieuwigheid boven publieksgrootte prioriteren." Dat werkt misschien goed voor een feestje op vrijdagavond, maar dat zou een ramp zijn voor een rustige dinsdagochtend met het nieuws. Het artikel stelt dat de "receptuur" voor een goede beslissing moet veranderen afhankelijk van de situatie (de context).

2. De oplossing: Een kameleon-chef

Het CSTS-systeem is als een kameleon-chef. Het heeft geen vast regelboek. In plaats daarvan leert het om zijn prioriteiten aan te passen op basis van het "weer" van het moment.

  • De ingrediënten (Waarde-signalen): Het systeem kijkt naar elke filmkandidaat en scoort deze op vijf verschillende "smaakprofielen": Publiek, Diversiteit, Nieuwigheid, Rechten en Concurrentie.
  • De context (Het weer): Het kijkt naar het specifieke tijdslot. Is het vrijdagavond? Is het een feestdag? Laat een rivaliserend kanaal een grote film zien?
  • De magie (Contextuele Scalarisatie): Het systeem leert deze vijf smaken te mengen tot één enkele "smaakscore".
    • Voorbeeld: Op vrijdagavond kan het besluiten: "Oké, laten we 40% Publiek, 30% Nieuwigheid en 30% Diversiteit mengen."
    • Voorbeeld: Op een dinsdagochtend kan het overschakelen naar: "Laten we 10% Publiek, 50% Rechten (we moeten verlopende contracten gebruiken) en 40% Diversiteit mengen."

3. Hoe het leert (De "Gokker"-analogie)

Het systeem gebruikt een techniek genaamd Thompson Sampling. Denk hierbij aan een slimme gokker die een notitieblok bijhoudt van wat werkt.

Elke keer als de menselijke chef een keuze maakt, controleert het systeem zijn notitieblok.

  • Als het systeem de juiste "mix van smaken" voor die situatie heeft geraden, krijgt het een duim omhoog.
  • Als het systeem het fout heeft geraden, leert het ervan.
  • Cruciaal is dat het systeem onzeker is over nieuwe situaties. Wanneer het onzeker is, probeert het een paar verschillende "mengsels" uit om te zien wat er gebeurt (exploratie). Naarmate het meer data verzamelt, wordt het zelfverzekerder en houdt het vast aan wat werkt (exploitatie).

Dit stelt het systeem in staat om de perfecte balans te vinden voor elk specifiek tijdslot, in plaats van een generiek gemiddelde te gebruiken.

4. Wat gebeurde er toen ze het testten?

De onderzoekers testten deze assistent met behulp van twee jaar echte data van de Zwitserse omroep. Ze vergeleken de AI met:

  1. Vaste Regels: Een systeem dat nooit zijn prioriteiten verandert.
  2. Standaard AI: Systemen die alleen zoeken naar de meest populaire films.
  3. Menselijke Experts: De werkelijke keuzes gemaakt door de curatoren.

De resultaten:

  • Beter in "het gevoel aanvoelen": Het CSTS-systeem was veel beter in het vinden van films die pasten bij de specifieke context van het tijdslot (bijv. een familiefilm vinden voor zaterdagochtend) vergeleken met de andere systemen. Het behaalde een relevantiepercentage van 98,7% in het vinden van geschikte opties, waarmee het het systeem met vaste regels (92,0%) en de standaard AI (80,0%) versloeg.
  • Niet alleen de geschiedenis kopiëren: Interessant genoeg was het "Vaste Regels"-systeem iets beter in het raden van de exacte film die de mens koos in het verleden. De auteurs argumenteren echter dat mensen soms inconsistente of suboptimale keuzes maken. CSTS is beter in het vinden van de best mogelijke film voor die specifieke situatie, zelfs als het niet exact de film is die de mens de vorige keer koos.
  • Balansact: Het systeem slaagde erin om "Rechten" (het opgebruiken van verlopende contracten) en "Diversiteit" vaker te prioriteren dan de vaste regels deden, terwijl de vaste regels geobsedeerd waren door "Nieuwigheid".

De Kern

Het artikel beweert dat CSTS een beslissingsondersteunend instrument is dat menselijke curatoren helpt bij het beheren van een enorme filmbibliotheek. In plaats van één rigide set regels op elke beslissing te leggen, fungeert het als een flexibele expert die weet: "Op dit moment, voor dit specifieke tijdslot, moeten we ons richten op X, maar volgende week moeten we ons richten op Y."

Het vervangt de menselijke chef niet; het geeft hem een shortlist van de top 5 beste opties die perfect aansluiten bij het huidige "weer", waardoor de taak van de mens om de uiteindelijke keuze te maken veel gemakkelijker en effectiever wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →