← Nieuwste papers
🤖 AI

Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System

Het artikel introduceert SHARP, een nieuw framework dat de uitdaging van credit assignment in multi-agent systemen met Large Language Models aanpakt door gebruik te maken van Shapley-gebaseerde marginale kredietbeloningen om bijdragen nauwkeurig toe te schrijven, waardoor het bestaande state-of-the-art methoden op het gebied van trainingsstabiliteit en prestaties aanzienlijk overtreft.

Oorspronkelijke auteurs: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

Gepubliceerd 2026-06-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een onderzoeksteam met hoge inzet. Je doel is om een complex mysterie op te lossen, zoals het vinden van de exacte specificaties van een nieuwe computerchip. Je hebt een Planner (de baas die het grote probleem opbreekt in kleine taken) en verschillende Workers (specialisten die daadwerkelijk het werk verrichten, zoals het doorzoeken van het internet of het uitvoeren van berekeningen).

In het verleden, wanneer dit team slaagde of faalde, was het beloningssysteem erg bot. Als het team het juiste antwoord vond, kreeg iedereen een gouden ster. Als ze faalden, kreeg iedereen een rode kaart.

Dit creëerde een groot probleem: Wie verdient eigenlijk de eer?

  • Gaaf de Planner een geweldig stappenplan?
  • Heeft Worker A een perfect artikel gevonden?
  • Heeft Worker B tijd verspild aan een doodlopende zoekopdracht?
  • Heeft Worker C een rekenfout gemaakt?

Omdat het team dezelfde beloning kreeg ongeacht de individuele prestaties, was het "leertraject" rommelig. De Planner wist niet of zijn strategie goed was, en de Workers wisten niet of hun specifieke acties nuttig of schadelijk waren. Het was als een sportteam waarbij de hele ploeg de trofee krijgt bij een overwinning, zelfs als één speler constant over de bal struikelt.

Maak kennis met SHARP: Het "Fair Share"-systeem

Het paper introduceert een nieuwe methode genaamd SHARP (Shapley Credit-based Optimization for Reinforcement Policy). Zie SHARP als een geavanceerd boekhoudsysteem dat precies uitrekent hoeveel elk persoon heeft bijgedragen aan het uiteindelijke resultaat.

Zo werkt SHARP, met een eenvoudige analogie:

1. De Scorekaart met drie onderdelen

In plaats van één grote beloning, breekt SHARP de score af in drie specifieke delen voor elk teamlid:

  • De "Hebben we gewonnen?" Bonus (Globale Nauwkeurigheid): Als het team het mysterie oplost, krijgt iedereen een basisbonus. Dit houdt iedereen gericht op het hoofddoel.
  • De "Wat als?" Bonus (Shapley Credit): Dit is het magische deel. SHARP stelt een tegenfeitelijke vraag: "Wat zou er gebeurd zijn als we deze specifieke persoon uit het team hadden verwijderd?"
    • Als het team zonder Worker A faalt, maar met hen slaagt, krijgt Worker A een enorme "marginale kredietscore". Zij waren essentieel!
    • Als het team zonder Worker B net zo goed presteert, of zelfs beter, krijgt Worker B een lage (of negatieve) score. Zij waren niet helpend.
    • Dit is gebaseerd op een wiskundig concept genaamd Shapley-waarden, wat een eerlijke manier is om een pizza te verdelen op basis van hoe hongerig iedereen werkelijk is, in plaats van het simpelweg gelijkelijk te verdelen.
  • De "Heb je je werk gedaan?" Bonus (Tool Process): Dit controleert of de workers hun tools correct hebben gebruikt. Als een worker probeerde een rekenmachine te gebruiken maar de verkeerde formule invoerde, verliezen ze hier punten, zelfs als het uiteindelijke antwoord door geluk goed was.

2. De "Planner vs. Worker" Dans

In dit systeem worden de Planner en de Workers samen getraind met een gedeeld brein (één Large Language Model).

  • De Planner krijgt krediet op basis van hoe goed de Workers die zij hebben toegewezen hebben gepresteerd. Als de Planner een taak toewijst aan een worker die faalt, leert de Planner om de volgende keer betere workers te kiezen.
  • De Workers krijgen krediet op basis van of hun specifieke acties het verschil hebben gemaakt.

3. De Resultaten: Een beter team

Het paper testte dit systeem op echte puzzels (zoals complexe wiskundige problemen en webzoekopdrachten). Dit is wat ze vonden:

  • Betere Prestaties: Teams die getraind zijn met SHARP losten aanzienlijk meer problemen correct op dan teams met oude methoden. Ze verbeterden met ongeveer 23% ten opzichte van teams met één persoon en met 14% ten opzichte van andere teams met meerdere personen.
  • Minder Verspilling: Het systeem leerde om "slecht" gedrag te stoppen. Het verminderde het aantal keren dat workers nutteloze of schadelijke taken uitvoerden (zoals zoeken naar het verkeerde ding) door deze eruit te filteren.
  • Stabiliteit: Het trainingsproces verliep soepeler. Omdat iedereen precies wist wat hij goed of fout deed, raakte het team niet in de war of in een loop van slechte gewoontes.

De Kernboodschap

SHARP is een nieuwe manier om AI-teams te trainen. In plaats van het team te behandelen als één grote brok die een generieke beloning krijgt, fungeert het als een eerlijke scheidsrechter die elke beweging volgt. Het vraat: "Wie heeft er echt het verschil gemaakt?" en beloont (of corrigeert) elke agent dienovereenkomstig. Dit leidt tot slimmere, efficiëntere teams die moeilijkere problemen kunnen oplossen zonder tijd te verspillen aan nutteloze acties.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →