Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents
Dit artikel formaliseert en kwantificeert de faalmodus "lokaal coherent, globaal incoherent" in multi-component LLM-agenten met behulp van een tijdens de runtime berekenbare compositionele residual, en toont aan dat lokale coherentie vaak faalt om globale waarschijnlijkheidsconsistentie te waarborgen, dat huidige mitigaties aan de LLM-kant inefficiënt zijn, terwijl deterministische projectie en sequentiële monitoring levensvatbare oplossingen bieden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: Het Dilemma van "Te Veel Koks"
Stel je voor dat je een restaurant runt waar je vier verschillende expertkoks hebt ingehuurd om één enkel, massaal banket te plannen.
- Kok A krijgt alleen de opdracht om de Voorgerechten te plannen.
- Kok B krijgt alleen de opdracht om het Hoofdgerecht te plannen.
- Kok C krijgt alleen de opdracht om het Toetje te plannen.
- Kok D krijgt alleen de opdracht om de Drankjes te plannen.
Elke kok is een genie. Ze zijn perfect zelfverzekerd in hun eigen onderdeel. Kok A zegt: "Ik ben 80% zeker dat we 50 voorgerechten nodig hebben." Kok B zegt: "Ik ben 80% zeker dat we 50 hoofdgerechten nodig hebben." Enzovoort.
Het Probleem: De restaurantbaas (de "Agent") telt gewoon alle getallen bij elkaar op. Maar omdat de koks niet met elkaar hebben gesproken, kunnen ze per ongeluk plannen voor 200 mensen terwijl het restaurant slechts plaats biedt aan 100. Of, ze plannen misschien voor 100% kans op voorgerechten én 100% kans op hoofdgerechten, zelfs al staat het menu alleen toe dat één van die opties per tafel gebeurt.
In de wereld van AI noemen we dit "Lokaal Coherent, Globaal Incoherent."
- Lokaal Coherent: Elk AI-model (kok) doet een goed werk op zijn eigen kleine taak.
- Globaal Incoherent: Wanneer je hun antwoorden bij elkaar voegt, klopt de totale wiskunde niet. De kansen tellen op tot meer dan 100% (of minder), wat een logische puinhoop creëert.
De Belangrijkste Ontdekking van het Artikel
De auteurs ontdekten dat zelfs als elk enkel AI-model op zichzelf perfect gekalibreerd en logisch is, het combineren ervan de wiskunde vaak verpest.
Ze noemen deze verpestte wiskunde een "Compositional Residual" (). Denk hierbij aan een "Vuilnis-meter".
- Als de meter 0 aangeeft, is het gecombineerde antwoord perfect.
- Als de meter hoog aangeeft, is het gecombineerde antwoord logisch gebroken (bijvoorbeeld: beweren dat er 150% kans is op regen).
Ze testten dit op bijna 2.000 verschillende scenario's (zoals het voorspellen van verkiezingsoverwinnaars, sportuitslagen of tech-beursgang) met vier verschillende AI-modellen. Ze ontdekten dat 33% tot 94% van de tijd het gecombineerde antwoord gebroken was, zelfs al werkten de individuele AI-onderdelen prima.
Waarom gebeurt dit?
Het artikel legt uit dat de AI-modellen "blind" zijn voor het grote geheel.
- De Blinde Specialist: Wanneer je een AI vraagt: "Wat is de kans dat de VS het WK wint?", beantwoordt het dit op basis van zijn training.
- De Ontbrekende Context: Het weet niet dat je ook een andere AI hebt gevraagd: "Wat is de kans dat Brazilië wint?" en "Wat is de kans dat Duitsland wint?".
- Het Resultaat: De VS-AI zegt 60%, Brazilië zegt 60%, en Duitsland zegt 60%. Het totaal is 180%. Dit is onmogelijk. De AI wist niet dat het deel uitmaakte van een team waar het totaal 100% moet bedragen.
De Oplossingen die ze Probeerden (en Faalden)
De onderzoekers probeerden dit op te lossen met "zachte" methoden, die lijken op het geven van betere instructies aan de koks:
- Retrieval: De koks laten opzoeken op Google. (Gefaald: Ze konden het totaal nog steeds niet overeenstemmen).
- Betere Prompts: De koks vertellen: "Vergeet niet, je maakt deel uit van een team, en je antwoorden moeten optellen tot 1." (Gefaald: Ze maakten nog steeds fouten).
- De "Baas"-AI: Een slimme AI-manager die luistert naar alle koks en de antwoorden herschrijft. (Gefaald: De manager maakte het vaak erger of loste de wiskunde niet op).
De Conclusie: Je kunt dit niet oplossen door gewoon beter met de AI te praten. De AI-modellen zijn per ontwerp te geïsoleerd.
De Echte Oplossing: De "Wiskundige Corrector"
Omdat je de koks niet kunt repareren, heb je een Wiskundige Corrector nodig die ingrijpt nadat de koks klaar zijn.
De auteurs stellen een methode voor genaamd Hierarchical Boyle–Dykstra Projection.
- De Analogie: Stel je voor dat de koks je een lijst met ingrediënten geven die 200 kg weegt, maar je vrachtwagen kan maar 100 kg dragen. In plaats van de koks te vragen hun lijsten te herschrijven (wat ze slecht doen), gebruik je gewoon een machine om het overbodige gewicht van de bovenkant van de stapel te trimmen tot het precies in de vrachtwagen past, terwijl je de relatieve verhoudingen van de ingrediënten zo dicht mogelijk bij het origineel houdt.
- Hoe het werkt: Het systeem neemt het gebroken, boven-de-100% antwoord en gebruikt een strikte wiskundige formule om het te "projecteren" op een geldige, logische vorm (een "polytoop"). Het dwingt de getallen om de wetten van de waarschijnlijkheid te gehoorzamen, zonder dat de AI erover hoeft na te "denken".
Deze methode is deterministisch (het werkt altijd op dezelfde manier) en snel. Het verandert een gebroken, 150% waarschijnlijkheidsantwoord direct in een perfect 100% antwoord.
Waarom moet je hier om geven? (De "Regret"-Factor)
Het artikel toont aan dat dit niet zomaar een theoretisch wiskundig probleem is; het kost echt geld bij besluitvorming.
- Als je een gokker of besluitnemer bent die deze AI-agenten gebruikt, leidt een gebroken antwoord tot regret. Je zou misschien wedden op een paard waarvan de AI zegt dat het 60% kans heeft, maar omdat de wiskunde van de AI gebroken was, was die 60% eigenlijk een leugen.
- Door hun "Wiskundige Corrector" te gebruiken, toonden ze aan dat je geld kunt besparen (gemeten in "nats", een eenheid voor informatiewinst) omdat je stopt met wedden op basis van onmogelijke wiskunde.
Samenvatting in Één Zin
Wanneer je meerdere AI-modellen vraagt om delen van een groot raadsel op te lossen, geven ze vaak antwoorden die niet optellen; de beste manier om dit op te lossen is niet om ze te vragen harder te proberen, maar om een wiskundig "trimhulpmiddel" te gebruiken om hun antwoorden logisch te maken voordat je ze gebruikt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.