Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita
Dit artikel introduceert Incognita, een framework voor het evalueren van generatieve agenten in sociaal verdeelde taakomgevingen waarin kennis is verdeeld over rol-geïsoleerde entiteiten, waarbij wordt aangetoond dat hoewel huidige modellen verbeterde gedragingen vertonen zoals kennisextractie en verminderde voortijdige afronding, hun algehele succespercentages laag blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het "Geheime Recept" Probleem
Stel je voor dat je een complexe taart probeert te bakken, maar je hebt niet het volledige recept. In plaats daarvan zijn de ingrediënten en instructies verspreid over vijf verschillende mensen in een kamer:
- Persoon A weet de naam en het adres van de klant.
- Persoon B weet welke taarten op voorraad zijn.
- Persoon C weet hoe je een terugbetaling moet verwerken.
- Persoon D kent de regels voor het wijzigen van een bestelling.
- Persoon E is de klant, die alleen weet wat hij wil kopen, maar niet de technische details.
Als jij (de AI-agent) alleen Persoon A vraagt naar het adres, kun je de taart niet bakken. Je moet eerst met Persoon B praten om de voorraad te controleren, dan met Persoon C om te betalen, enzovoort. Als je het recept raadt of te vroeg stopt met praten, mislukt de taart.
Dit paper introduceert een nieuwe manier om AI-agenten te testen, genaamd Incognita. Het dwingt AI om dit "gespreide kennis"-spel te spelen om te zien of ze daadwerkelijk problemen kunnen oplossen in een sociale wereld, in plaats van alleen een enkele lijst met instructies te volgen.
De Opzet: Een Nieuw Speelveld
De onderzoekers hebben een bestaande test (genaamd tau-bench, wat lijkt op een standaard rijexamen voor AI) uit elkaar gehaald. Ze hebben een enkel "alwetend" systeem veranderd in een Socially Distributed Task Environment (een sociaal verdeelde taakomgeving).
Zie het zo voor je:
- De Oude Manier: De AI zit in een controlekamer met een enorme kaart en een directe telefoonlijn naar het magazijn. Het kan alles zien en alles direct doen.
- De Incognita-Manier: De AI zit in een druk kantoor. Het kan slechts één tekstbericht tegelijk sturen naar specifieke collega's (gespecialiseerde entiteiten) of de klant. Het kan het magazijn of de privénotities van de klant niet zien, tenzij het de juiste persoon om informatie vraagt.
Hoe het Spel Werkt
De AI speelt drie verschillende rollen in deze omgeving:
De Verkenner (Vragen stellen):
De AI moet ontdekken wie wat weet. De AI stelt vragen aan de "Klant" (die het doel bezit) en de "Specialisten" (die de data bezitten). Dit is als een detective die getuigen ondervraagt om een zaak op te bouwen. De AI leert dat het niet zoma van een gok kan doen; het moet aanwijzingen verzamelen.De Doener (Actie ondernemen):
Zodra de AI genoeg aanwijzingen heeft, moet het actie ondernemen. Maar de AI kan niet zomaar dingen "doen". Het moet een specialist vragen om een specifieke taak uit te voeren (zoals "het verzendadres wijzigen"). Het systeem controleert of het verzoek logisch is. Als de AI probeert een adres te wijzigen voor een bestelling die nog niet is verzonden, zegt het systeem "Nee". Dit zorgt ervoor dat de acties van de AI gegrond zijn in de realiteit, en niet slechts hallucinaties zijn.De Rechter (Beslissen wanneer te stoppen):
Het moeilijkste deel is weten wanneer de klus geklaard is. De AI moet beslissen: "Oké, ik heb alle info en ik heb het werk gedaan. Ik ben klaar." Als de AI te vroeg stopt (voortijdige afronding), faalt het. Als het eeuwig door blijft vragen, faalt het ook.
Wat Ze Vonden
De onderzoekers testten drie versies van een AI (laten we ze "Junior", "Mid-Level" en "Senior" noemen) op 18 verschillende taken.
- De Junior Agent: Deze was erg ongeduldig. Het probeerde de taak onmiddellijk te voltooien zonder iemand iets te vragen. Het faalde 100% van de tijd omdat het de regels of de behoeften van de klant niet kende.
- De Mid-Level Agent: Deze begon vragen te stellen en met meer mensen te praten. Het kreeg een paar taken goed (ongeveer 9% succes), maar gaf soms nog steeds te snel op.
- De Senior Agent: Deze was veel beter in het verkennen. Het sprak met meer specialisten, stelde diepere vragen en probeerde meer acties uit. Het slaagde ongeveer 17% van de tijd.
De Belangrijkste Conclusie:
Zelfs de "Senior" agent was niet perfect. Het faalde nog steeds vaker dan het slaagde. Echter, het paper laat zien dat vooruitgang zichtbaar is in het gedrag, niet alleen in de eindscore. De intelligentere agenten haalden niet alleen vaker het juiste antwoord; ze veranderden ook hoe ze werkten:
- Ze vroegen om meer verborgen informatie.
- Ze namen contact op met meer verschillende mensen.
- Ze probeerden meer echte acties (zoals het bijwerken van een database).
- Ze stopten met gokken en wachtten tot ze genoeg bewijs hadden voordat ze zeiden: "Ik ben klaar."
Waarom Dit Belangrijk Is
Het paper betoogt dat we niet alleen kunnen kijken naar of een AI een taak heeft voltooid om te weten of het "slim" is. We moeten kijken naar hoe het met de wereld interacteert.
In de echte wereld is kennis verspreid. Geen enkele persoon (of AI) weet alles. Om echt effectief te zijn, moet een AI weten:
- Wanneer te vragen (Exploratie).
- Wie te vragen (Bronselectie).
- Wanneer te handelen (Gegronde uitvoering).
- Wanneer te stoppen (Geloof in voltooiing).
Incognita is een hulpmiddel waarmee we deze vier zaken in realtime kunnen observeren, wat ons precies laat zien waar AI-agenten vastlopen en hoe ze leren om betere samenwerkers te worden.
Samenvatting in één zin
Het paper bouwt een nieuw testveld waar AI-agenten problemen moeten oplossen door met verschillende "experts" te praten om verspreide informatie te verzamelen, wat bewijst dat intelligentere agenten leren om betere vragen te stellen en te wachten op het juiste moment om te handelen, zelfs als ze het uiteindelijke resultaat nog niet altijd perfect krijgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.