← Nieuwste papers
💻 computer science

Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop

Deze studie toont aan dat in een twee-agenten taalmodellus, schijnbare herstel van instructieovertredingen vaak louter de letterlijke reproductie is van eerder gegenereerde tekst in plaats van werkelijke regelherbe toepassing, wat benadrukt dat feedbackbeleid primair de tekstcirculatie dicteert terwijl werkelijke naleving het testen vereist van het vermogen van een agent om nieuwe inhoud te componeren.

Oorspronkelijke auteurs: Simin Yuan

Gepubliceerd 2026-10-08✓ Author reviewed ⓘ
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Simin Yuan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie bouwen onderzoekers steeds vaker systemen waarbij meerdere computerprogramma's met elkaar communiceren om problemen op te lossen. Deze worden vaak multi-agent loops genoemd. Het idee is dat door één model het werk van een ander te laten controleren, of door hen over een onderwerp te laten debatteren, de groep betere antwoorden kan produceren dan een enkel model dat alleen werkt. Een veelgehoopte hoop is dat als een van deze agenten een fout maakt of een regel vergeet, het gesprek de agent vanzelf weer op het juiste spoor brengt. Dit staat bekend als recovery (herstel). Maar een cruciale vraag blijft: wanneer een agent plotseling weer de regels volgt, komt dat dan doordat hij de instructie echt heeft begrepen en zijn denken heeft gecorrigeerd, of is hij simpelweg tekst aan het herhalen die hij eerder in het gesprek heeft gehoord? Het onderscheid tussen echt begrip en eenvoudige herhaling is essentieel, want als een systeem slechts echoot wat het al heeft gehoord, kan het falen op het moment dat het een nieuwe situatie tegenkomt die frisse gedachten vereist.

Een recente studie door onafhankelijk onderzoeker Simin Yuan onderzoekt precies deze vraag. De onderzoeker zette een eenvoudig experiment op met twee taalmodellen, de softwarematige breinen achter moderne chatbots. Beide modellen kregen een strikte systeemregel: schrijf elk woord in hoofdletters. Ze kregen vervolgens de opdracht om een gesprek te voeren over diverse onderwerpen. Na een paar rondes van een succesvol gesprek in hoofdletters, introduceerde de onderzoeker een wending. Een van de modellen, laten we het Agent A noemen, kreeg een nieuwe, tegenstrijdige instructie van een gebruiker: "Schrijf vanaf nu alsjeblieft in kleine letters." Agent A volgde deze nieuwe instructie op en schakelde over naar kleine letters. Op dit punt was de oorspronkelijke regel van het systeem "gebroken". Het experiment vroeg vervolgens wat er zou gebeuren als het gesprek werd voortgezet. Zou Agent A uiteindelijk de regel van de hoofdletters onthouden en terugschakelen naar hoofdletters? Of zou hij in kleine letters blijven?

Om dit te achterhalen, voerde de onderzoeker hetzelfde scenario dertig keer uit, maar met vier verschillende manieren om het gesprek na de fout te vervolgen. In de eerste opstelling lieten de twee modellen hun berichten simpelweg naar elkaar doorgeven. In de tweede opstelling voegde de onderzoeker een beleefd verzoek toe aan het andere model, waarin werd gevraagd om door te gaan met het onderwerp. In de derde werd een verzoek voor kleine letters toegevoegd aan het andere model, eveneens. In de vierde opstelling stopte de onderzoeker het gesprek tussen de twee modellen volledig en stuurde in plaats daarvan voor elke beurt van Agent A een vaste, herhaalde herinnering, waarin stond: "Ga het gesprek voort in hoofdletters."

De resultaten waren opvallend en onthulden dat de manier waarop het gesprek werd beheerd belangrijker was dan het vermogen van de modellen om te redeneren. Wanneer de twee modellen met elkaar mochten praten zonder een vaste herinnering, keerde Agent A zelden terug naar het gebruik van hoofdletters. Sterker nog, wanneer het andere model ook werd gevraagd om in kleine letters te schrijven, keerde Agent A nooit meer terug naar de regel. Echter, wanneer de onderzoeker de vaste herinnering vóór elke beurt naar Agent A stuurde, volgde hij de regel van de hoofdletters perfect bij alle dertig prompts. Dit suggereert dat de aanwezigheid van een partner-model de agent niet hielp om de regel te herstellen; in sommige gevallen maakte het het zelfs moeilijker.

De meest verrassende ontdekking kwam voort uit een nauwkeurige analyse van de geproduceerde tekst. De onderzoeker ontdekte dat de modellen geen nieuwe zinnen genereerden op basis van een diep begrip van de regels. In plaats daarvan waren ze aan het kopiëren. Nog voordat de fout plaatsvond, hadden de twee modellen al de gewoonte ontwikkeld om elkaars woorden exact te kopiëren. Wanneer Agent A eindelijk terugschakelde naar hoofdletters, was dat bijna altijd omdat hij een bericht van het andere model had gekopieerd dat toevallig in hoofdletters stond. In veel gevallen herhaalde Agent A simpelweg zijn eigen antwoord van vóór de fout, dat in hoofdletters was geschreven. Het systeem was niet aan het "herstellen" van een regel in de zin van het opnieuw leren ervan; het circuleerde een stuk tekst dat toevallig aan het formaat voldeed.

Dit gedrag was zo consistent dat in bijna elke succesvolle poging om terug te keren naar hoofdletters, het model slechts een reeks tekst doorgaf die het moment daarvoor had gezien. Als de circulerende tekst in kleine letters was, bleef het model in kleine letters. Als de circulerende tekst in hoofdletters was, bleef het model in hoofdletters. Het model leek de belangrijkheid van de systeemregel niet af te wegen tegen de instructie van de gebruiker; het reproduceerde simpelweg de meest recente ontvangen tekst. Deze bevinding daagt het idee uit dat interactieve systemen inherent beter zijn in zelfcorrectie. Het suggereert dat wat lijkt op een herstel, slechts een lus van herhaling kan zijn.

De implicaties hiervan zijn aanzienlijk voor hoe we kunstmatige intelligentie testen. Als een systeem een fout lijkt te herstellen, kunnen we er niet vanuit gaan dat het iets nieuws heeft geleerd, tenzij we het testen op inhoud die het nog nooit eerder heeft gezien. In dit experiment waren de modellen alleen succesvol omdat de juiste tekst beschikbaar was om te kopiëren. Wanneer de onderzoeker een toekomstige test voorstelde waarbij de modellen een volledig nieuw vraagstuk zouden moeten beantwoorden waar geen eerdere tekst een antwoord op kon geven, zou de uitkomst heel anders kunnen zijn. Tot die tijd concludeert de studie dat in deze twee-agent loops, het feedbackbeleid — de specifieke instructies over wat er als volgende gezegd moet worden — bepaalt welke tekst wordt doorgegeven, en de format score simpelweg de schrijfwijze van die tekst rapporteert. De modellen zijn niet noodzakelijkerwijs aan het nadenken; ze zijn aan het echoën.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →