MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems
MASPO is een nieuw raamwerk dat prompts voor op LLM gebaseerde multi-agent systemen automatisch optimaliseert door een gezamenlijk evaluatiemechanisme en evolutionaire beam search toe te passen om lokale agentdoelen af te stemmen op globale systeemdoelen, waardoor het bestaande methoden overtreft op diverse samenwerkende taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van expertrobots hebt die samenwerken om een zeer moeilijk raadsel op te lossen. Elke robot heeft een specifieke taak: één leest de aanwijzingen, een ander doet de wiskunde, een derde controleert op fouten, en een vierde schrijft het uiteindelijke antwoord.
In het verleden was het, als het team faalde, moeilijk te weten wie de schuldige was. Was de wiskundige robot slecht in rekenen? Of gaf de robot die de aanwijzingen las de verkeerde aanwijzingen? Dit is het probleem dat het paper MASPO oplost.
Hier is hoe MASPO werkt, uitgelegd via eenvoudige analogieën:
1. Het Probleem: Het "Schuldspel" in een Team
Meestal kijken we, wanneer we deze robotteams trainen, alleen naar het uiteindelijke antwoord. Als het antwoord verkeerd is, weten we niet welke robot het heeft verprutst.
- De Analogie: Stel je een estafettewedstrijd voor. Als het team verliest, kun je niet gewoon de laatste loper uitmaken. Misschien liet de eerste loper de stok vallen, of liep de tweede loper het verkeerde pad. Als je alleen de laatste loper traint om sneller te rennen, zal het team nog steeds verliezen omdat de stokoverdracht gebroken is.
- Het Inzicht van het Paper: De auteurs realiseerden zich dat in een multi-agent-systeem een robot zijn eigen taak perfect kan uitvoeren (lokale succes), maar toch informatie aan de volgende robot kan geven die leidt tot een totale mislukking (globale mislukking). Dit heet "Lokaal-Globale Misalignering".
2. De Oplossing: MASPO (De Teamcoach)
MASPO is een nieuw raamwerk dat fungeert als een slimme coach die niet alleen naar de finishlijn kijkt, maar naar elke enkele stokoverdracht in de estafettewedstrijd. Het herschrijft automatisch de "handleidingen" (prompts) voor elke robot om het hele team beter samen te laten werken.
Het doet dit met drie hoofdtactieken:
A. De "Toekomstbestendige" Scorekaart (Gecombineerde Evaluatie)
In plaats van alleen te vragen: "Heeft deze robot zijn taak gedaan?", vraagt MASPO: "Heeft het werk van deze robot de volgende robot geholpen om te slagen?"
- De Analogie: Stel je een chef-kok voor die een maaltijd bereidt. Een standaard jurylid proeft misschien alleen de soep en zegt: "Het is zout." Maar MASPO is als een jurylid dat ook vraagt: "Is deze soep zout genoeg om goed te passen bij het brood dat de volgende chef bakt?"
- Hoe het werkt: MASPO geeft elke robot een score op basis van drie dingen:
- Hebben ze hun eigen regels gevolgd? (Lokale Validiteit)
- Heeft hun output het werk van de volgende robot makkelijker gemaakt? (Vooruitkijkend Potentieel)
- Heeft het het team geholpen om het eindspel te winnen? (Globale Alignering)
B. Leren van "Bijna"-Rampen (Misalignering Mining)
De meeste systemen leren alleen van fouten waarbij het eindantwoord verkeerd was. MASPO zoekt naar een specifiek, sluipend type fout: wanneer een robot zijn taak perfect heeft uitgevoerd, maar het team toch faalde.
- De Analogie: Stel je een bestuurder voor die elke verkeerswet perfect volgt (lokale succes), maar per ongeluk een doodlopende straat inrijdt omdat de kaart verwarrend was (globale mislukking). Een normale coach zou zeggen: "Goed gedaan, bestuurder!" MASPO zegt: "Wacht, je hebt de regels gevolgd, maar we zijn toch verdwaald. Laten we je instructies aanpassen zodat je de volgende keer niet in doodlopende straten rijdt."
- Hoe het werkt: Het systeem slaat deze gevallen van "Lokaal Succes, Globale Mislukking" op en dwingt de robots om ze te bestuderen, zodat ze dezelfde coördinatiefouten niet herhalen.
C. De "Hersynchronisatie"-Oefening (Beam Refresh)
Naarmate de robots leren en hun gedrag veranderen, kunnen de instructies voor de volgende robot plotseling verouderd raken.
- De Analogie: Stel je een dansteam voor. Als de eerste danser versnelt, is de timing van de tweede danser nu verkeerd. Als je de oude routine blijft oefenen, zullen ze elkaar blijven op de tenen trappen.
- Hoe het werkt: MASPO controleert het team voortdurend. Als de eerste robot zijn stijl heeft veranderd, update MASPO direct de "score" voor de instructies van de tweede robot, zodat ze oefenen tegen de huidige realiteit, en niet tegen een oude versie van het team.
3. De Resultaten: Een Beter Team
De auteurs hebben dit getest op 6 verschillende soorten moeilijke taken, waaronder complexe wiskunde, logische raadsels en het schrijven van computercode.
- Het Resultaat: De door MASPO getrainde teams presteerden consequent beter dan andere methoden. Ze verbeterden hun nauwkeurigheid met gemiddeld 2,9% ten opzichte van de beste bestaande methoden.
- Waarom dit belangrijk is: Dit bewijst dat door robots te leren om te geven om hoe hun werk hun teamgenoten beïnvloedt (niet alleen hun eigen taak), het hele systeem veel slimmer wordt.
Samenvatting
Denk aan MASPO als een teamcoach die het playbook in real-time herschrijft. In plaats van de spelers alleen te vertellen om "hun best te doen", analyseert het hoe de pass van Speler A de vangst van Speler B beïnvloedt, en herschrijft het de instructies voor beiden om ervoor te zorgen dat het hele team wint, niet alleen de individuele spelers. Het lost het probleem op van "Ik heb mijn taak gedaan, maar we hebben toch verloren" door ervoor te zorgen dat ieders taak is ontworpen om het team te helpen winnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.