← Nieuwste papers
🤖 AI

A Better Spur Should Start From Each Objective

Het artikel stelt Multi-Marginal Preference Optimization (MMPO) voor, een fijnmazig framework dat schaarse beloningen en optimalisatieconflicten in real-world Multi-Objective Reinforcement Learning aanpakt door te interveniëren op het niveau van data, gradiënten en restricties om stabiele, hoogwaardige afstemming over diverse taken heen te bereiken.

Oorspronkelijke auteurs: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Gepubliceerd 2026-09-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de digitale marktplaats is een productpagina vaak een dichte muur van tekst, volgestouwd met technische specificaties en marketingjargon die een shopper kunnen overweldigen. Om de kloof tussen complexe informatie en menselijk begrip te overbruggen, krijgt kunstmatige intelligentie steeds vaker de dubbelrol toegewezen: het identificeren van de belangrijkste woorden in een productbeschrijving en vervolgens het schrijven van een korte, heldere uitleg voor deze woorden. Dit is niet louter een tekstbewerkingsopdracht; het is een evenwichtsoefening. Het systeem moet voldoen aan strikte offline regels, zoals het waarborgen dat de geëxtraheerde woorden accuraat zijn en het volledige spectrum aan productkenmerken dekken, terwijl het tegelijkertijd online doelen nastreeft zoals het maximaliseren van gebruikersklikken en het minimaliseren van negatieve reacties. Deze doelen trekken vaak in tegengestelde richtingen. Een kenmerk dat veel klikken genereert, kan te generiek zijn om accuraat te zijn, terwijl een zeer nauwkeurige technische term te obscuur kan zijn om een gemiddelde zoeker te interesseren. Wanneer computerprogramma's proberen om tegelijkertijd voor al deze conflicterende doelen te optimaliseren, struikelen ze vaak, waarbij ze wild heen en weer slaan of vastlopen in een lus waarin het verbeteren van de ene metriek de ineenstorting van een andere veroorzaakt.

Onderzoekers van het Harbin Institute of Technology, JD.com en de Chinese Academy of Sciences hebben een nieuwe methode ontwikkeld om dit specifieke probleem van conflicterende doelen op te lossen. Ze noemen hun aanpak Multi-Marginal Preference Optimization, een systeem dat ontworpen is om de computer te stoppen met het behandelen van alle doelstellingen als één rommelige hoop instructies. In plaats van het model te dwingen een enkel "beste" antwoord te vinden dat op alles een compromis sluit, behandelt het nieuwe framework elk doel als een aparte rijstrook op een snelweg. Het zuivert eerst de gegevens die het ontvangt, door de ruis en de schaarse signalen die voortkomen uit echt gebruikersgedrag, zoals klikken en likes — die misleidend kunnen zijn als ze letterlijk worden genomen — te verzachten. Door aan te passen hoe de computer deze beloningen ziet, zorgt het systeem ervoor dat zeldzame maar waardevolle informatie niet wordt genegeerd simpelweg omdat deze minder vaak voorkomt dan veelvoorkomende termen.

De kerninnovatie ligt in de manier waarop het systeem het leerproces zelf afhandelt. Wanneer de computer probeert zijn prestaties te verbeteren, genereert het wiskundige updates gebaseerd op zijn doelen. Bij oudere methoden werden deze updates simpelweg bij elkaar opgeteld, wat er vaak toe leidde dat de instructies voor het ene doel de instructies voor het andere doel tegenwerkten of vervormden. De nieuwe methode scheidt deze updates voordat ze worden toegepast. Het identificeert welke delen van het leersignaal essentieel zijn voor basisnauwkeurigheid en welke delen specifiek zijn voor gebruikersvoorkeuren, en projecteert vervolgens de voorkeurssignalen in een ruimte waar ze niet interfereren met de kernregels. Dit stelt het model in staat om te leren interessanter te zijn voor gebruikers zonder per ongeluk te vergeten hoe het accuraat moet zijn.

Verder voegden de onderzoekers een veiligheidsmechanisme toe om te voorkomen dat het systeem te agressief wordt tijdens de latere stadia van de training. Naarmate modellen verbeteren, kunnen ze soms zo intens gefixeerd raken op één doel dat ze de andere verwaarlozen, wat leidt tot een plotselinge daling in de algehele kwaliteit. Het nieuwe systeem gebruikt het vermogen van het model om instructies op te volgen om een grens te stellen. Het vraagt het model om voorbeelden van perfect gedrag onder ideale omstandigheden te generen en gebruikt die voorbeelden om een veilige zone voor toekomstige updates te definiëren. Als het model te hard in één richting probeert te duwen, trekt deze interne gids het zachtjes terug, waardoor de voortgang stabiel en gebalanceerd blijft over alle metrieken.

De resultaten van deze aanpak werden getest op een dataset van echte e-commerce producten, bestaande uit 65.232 trainingsproducten en 8.879 evaluatieproducten, samen met gebruikersgedragsgegevens die over de afgelopen drie maanden zijn verzameld. Het systeem werd vergeleken met verschillende andere geavanceerde methoden en bleek aanzienlijk stabieler en effectiever. In offline tests behaalde het een volledigheidsscore van 94,11 procent en een nauwkeurigheid van 73,43 procent, waarmee het vorige methoden met grote marges versloeg. Cruciaal was dat het een doelstelling voor de dekkingsgraad van 22,82 procent wist te bereiken, wat bijna perfect is, terwijl andere methoden ofwel tekortschoten of de plank volledig missloegen. Deze verbeteringen waren niet alleen theoretisch; bij implementatie in een live online test met echte shoppers, verhoogde het door deze nieuwe methode aangestuurde systeem het aantal geplaatste bestellingen met 3,14 procent en de totale waarde van die bestellingen met 5,07 procent vergeleken met de vorige standaard.

Het succes van dit framework strekt zich uit buiten online winkelen. De onderzoekers hebben het ook toegepast op taken die het gebruik van tools en computercode-generatie omvatten, gebieden waar gelijktijdig aan meerdere beperkingen moet worden voldaan. In deze tests produceerde de methode consequent betere resultaten dan standaard benaderingen, met name door het vermijden van "mode collapse", waarbij een model één gemakkelijke oplossing vindt en deze eindeloos herhaalt. In plaats daarvan behield het nieuwe systeem een divers bereik aan hoogwaardige outputs terwijl het zich aan strikte regels hield. Door conflicterende doelen te ontkoppelen en een gestructureerde manier te bieden om ze in evenwicht te brengen, biedt dit werk een praktische oplossing om kunstmatige intelligentie betrouwbaarder te maken in complexe, reële omgevingen waar meerdere, concurrerende doelstellingen de norm zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →