← Nieuwste papers
💬 NLP

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE is een nieuw raamwerk dat LLM-gebaseerde multi-agent systemen optimaliseert door het credit-assignment-probleem op te lossen via contrastieve toewijzing van systeemniveau-beloningen aan individuele agenten, waarmee state-of-the-art prestaties worden bereikt in promptoptimalisatie over diverse benchmarks terwijl de inferentiekosten worden verlaagd.

Oorspronkelijke auteurs: Tom Zehle

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tom Zehle

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van drie experts hebt die samenwerken om een moeilijk raadsel op te lossen: een Planner die de stappen in kaart brengt, een Coder die de oplossing schrijft, en een Validator die controleert of het werkt. Dit noemt het artikel een "Multi-Agent System".

Het probleem dat de auteurs, onder leiding van Tom Zehle, hebben geïdentificeerd, is als volgt: wanneer het team faalt, krijg je één cijfer voor de hele groep (bijvoorbeeld: "Je hebt een C gekregen"). Maar je weet niet wie het heeft verprutst. Heeft de Planner slechte instructies gegeven? Heeft de Coder een typefout gemaakt? Of heeft de Validator een fout gemist?

Bij traditioneel machine learning krijgt het hele team hetzelfde cijfer, en probeert iedereen zijn gedrag aan te passen op basis van die ene score. Dit is alsof een trainer een voetbalteam zegt: "Jullie hebben het spel verloren", en vervolgens de doelman, de spits en de scheidsrechter allemaal vraagt hun strategieën te wijzigen op basis van die ene zin. Het is inefficiënt en verwarrend.

De Oplossing: CANTANTE

De auteurs introduceren een nieuw kader genaamd CANTANTE. Denk aan CANTANTE als een superslimme Sportanalist die het team meerdere keren dezelfde wedstrijd ziet spelen met lichtjes verschillende strategieën, en vervolgens precies analyseert wie heeft bijgedragen aan de winst of de nederlaag.

Hieronder wordt uitgelegd hoe het werkt, met een eenvoudige analogie:

1. Het "Wat als"-spel (Contrastieve Toewijzing)

In plaats van het team slechts één keer te beoordelen, voert CANTANTE het team drie of vier keer achter elkaar door hetzelfde raadsel.

  • Loop A: De Planner gebruikt een strenge toon, de Coder gebruikt een snelle stijl.
  • Loop B: De Planner gebruikt een vriendelijke toon, de Coder gebruikt dezelfde snelle stijl.
  • Loop C: De Planner gebruikt een strenge toon, de Coder gebruikt een trage stijl.

Na het uitvoeren hiervan krijgt het team een score voor elke loop. Nu komt de Attributor (de Analist) in actie. Hij kijkt naar de verschillen:

  • "In Loop A en Loop B was de Coder hetzelfde, maar de Planner veranderde. De score steeg. Dus, de nieuwe toon van de Planner was nuttig!"
  • "In Loop A en Loop C was de Planner hetzelfde, maar de Coder veranderde. De score daalde. Dus, de nieuwe stijl van de Coder was schadelijk."

Dit heet Contrastieve Toewijzing. Het isoleert de bijdrage van elke persoon door hen met elkaar te vergelijken, in plaats van alleen naar de eindscore te kijken.

2. Het "Credit Score" voor elke Agent

Zodra de Analist heeft uitgezocht wie het team heeft geholpen en wie het heeft geschaad, geeft hij elke agent een specifiek Credit Score (variërend van -1 tot +1).

  • Als de Planner een +0,8 krijgt, weet het systeem dat de instructies van de Planner moeten worden aangepast om meer te lijken op die succesvolle versie.
  • Als de Coder een -0,5 krijgt, weet het systeem dat de Coder moet worden weggestuurd van die specifieke stijl.

Cruciaal is dat het artikel beweert dat dit beter is dan simpelweg het globale cijfer overnemen. Op de oude manier, als het team faalt, kan de Planner de schuld krijgen, zelfs als de Planner een uitstekende job deed en de Coder het probleem was. CANTANTE lost dit op door te zeggen: "De Planner deed het goed; de Coder moet veranderen."

3. De Resultaten: Slimmere Teams, Minder Verspilling

De auteurs hebben dit getest op drie zeer verschillende soorten "raadsels":

  1. Coderen (MBPP): Computerprogramma's schrijven.
  2. Wiskunde (GSM8K): Woordproblemen oplossen.
  3. Onderzoek (HotpotQA): Complexe vragen beantwoorden die het opzoeken van informatie op meerdere plaatsen vereisen.

De Bevindingen:

  • Betere Scores: CANTANTE sloeg consequent andere methoden. Bij de coderingstaak verbeterde het de nauwkeurigheid met bijna 19% ten opzichte van de volgende beste methode. Bij de wiskundetaak verbeterde het met 12,5%.
  • Goedkoper om te draaien: Verrassend genoeg hadden de door CANTANTE geoptimaliseerde teams niet langer hoeven "na te denken" of meer rekenkracht nodig om het juiste antwoord te krijgen. Sterker nog, bij de coderings- en wiskundetaken gebruikten ze minder resources (tokens) dan de niet-geoptimaliseerde teams.
  • Stabiliteit: De methode had niet gewoon één keer geluk; het werkte consistent over verschillende willekeurige starts.

Waarom Dit Belangrijk Is (Volgens het Artikel)

Het artikel betoogt dat het bouwen van deze AI-teams geen spelletje "gokken en controleren" zou moeten zijn waarbij mensen handmatig prompts aanpassen. In plaats daarvan zou het een wetenschap moeten zijn van Toewijzing van Credits.

Net zoals een trainer niet het hele team uitmaakt wanneer een speler een schot mist, zorgt CANTANTE ervoor dat het AI-systeem precies leert welk deel van het team moet verbeteren. Het verandert de "zwarte doos" van een multi-agent systeem in een transparante machine waarbij elke agent precies weet hoe hij beter kan worden.

Kortom: CANTANTE is een methode die AI-teams in staat stelt te leren van hun fouten door te vragen: "Wie heeft specifiek dit resultaat veroorzaakt?" in plaats van gewoon te zeggen: "We zijn gefaald, probeer harder." Dit leidt tot slimmere, efficiëntere en nauwkeurigere AI-systemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →