Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues
Dit artikel presenteert een systematische evaluatie van de veelzijdige onderhandelingscapaciteiten van Large Language Models over diverse dialoogscenario's heen, waarbij de superieure prestaties van GPT-4 worden onthuld terwijl specifieke uitdagingen in subjectieve beoordeling en strategische responsgeneratie worden geïdentificeerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je met een buurman voorwerpen wilt ruilen om de beste deal te krijgen voor je kampeertrip. Jullie hebben allebei een lijst met dingen die jullie nodig hebben (eten, water, brandhout), en elk item is voor jou een ander aantal "punten" waard. Om te winnen, moet je de regels begrijpen, raden wat je buurman wil en de juiste dingen zeggen om de meeste punten te scoren zonder hem boos te maken.
Dit papier is als een rapportcijfer voor Kunstmatige Intelligentie (AI) die probeert dit handelsspelletje te spelen. De onderzoekers vroegen zich af: Kunnen moderne AI-chatbots (genaamd Large Language Models of LLM's) echt goede onderhandelaars zijn?
Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën:
1. De "Examen"-opzet
De onderzoekers keken niet alleen naar de AI terwijl deze chatte; ze gaven het een reeks specifieke tests, zoals een leraar die een leerling beoordeelt op verschillende vakken. Ze deelden de complexe handeling van onderhandelen op in vier hoofdvakken:
- Leesvaardigheid: Begreep de AI de regels en de uiteindelijke deal? (bijv. "Hoeveel punten heb ik gekregen?")
- Labelen: Kan de AI herkennen wat de andere persoon doet? (bijv. "Is die zin een 'voorstel' of een 'klacht'?")
- Gedachtenlezen (Theory of Mind): Kan de AI raden wat de ander wil of hoe tevreden diegene is, zelfs als dat niet hardop is gezegd?
- Spreken: Kan de AI een antwoord schrijven dat zowel beleefd als slim genoeg is om een goede deal te krijgen?
Ze testten dit op vier verschillende "handelsscenario's", variërend van het ruilen van kampeerspullen tot het onderhandelen over een salaris bij een baan.
2. De Sterleerling: GPT-4
De resultaten lieten zien dat GPT-4 momenteel de "eindexamenstudent" van deze klas is.
- Het goede nieuws: Het was aanzienlijk beter dan alle andere AI-modellen in het begrijpen van de regels, het doen van de berekeningen en het raden wat de ander wilde. In veel tests versloeg het zelfs een gespecialiseerde AI die specifiek voor dit doel was getraind (zoals een student die alleen voor deze ene test heeft gestudeerd) door een algemene AI die gewoon "veel wist".
- De "Menselijke" Touch: Wanneer het kwam op het schrijven van een reactie, klonk GPT-4 bijna even coherent en logisch als een menselijke expert.
3. De Moeilijkheden: Waar de AI in de war raakt
Zelfs de slimste AI had lastpunten, waarbij het gedrag vertoonde van een student die geweldig is in wiskunde maar slecht in sociale signalen lezen.
- De "Gedachtenlees"-fout: Wanneer de AI werd gevraagd te raden hoe tevreden de ander was met de deal, zat de AI er vaak naast. Het is als een student die denkt dat een leraar blij is omdat hij een 'A' heeft gehaald, terwijl de leraar eigenlijk woedend is omdat de student heeft valsgespeeld. De AI had moeite met het begrijpen van de gevoelens achter de woorden.
- De "Strategie"-fout: Soms ging de AI akkoord met een slechte deal om maar aardig te zijn. Het is als een kind bij een limonadekraampje dat al zijn citroenen weggeeft voor een cent, simpelweg omdat de klant zo vriendelijk vroeg, waardoor het vergeet dat het eigenlijk winst zou moeten maken. Het faalde vaak in het gebruiken van de gegeven informatie om de eigen belangen te beschermen.
- De "Echo-kamer": In sommige gevallen herhaalde de AI een aanbod dat de andere persoon al had afgewezen, alsojd het de geschiedenis van het gesprek niet meer kon herinneren. Het is als proberen een gesprek te voeren met iemand die steeds dingen voorstelt die je al eerder hebt afgewezen.
4. De "Cheat Codes" (Prompting)
De onderzoekers ontdekten dat de manier waarop je de AI een vraag stelt, bepaalt hoe goed deze presteert.
- Chain-of-Thought (CoT): Als je de AI vertelt: "Denk stap voor stap voordat je antwoordt," wordt het veel beter in wiskundige problemen. Het is alsof je een student vertelt: "Laat je berekeningen zien," wat helpt om het juiste antwoord te vinden.
- Few-Shot Learning: Als je de AI een paar voorbeelden geeft van hoe het moet antwoorden voordat je het vraagt een probleem op te lossen, presteert het beter. Het is alsof je een student een voorbeeldessay laat zien voordat je hem vraagt zelf een essay te schrijven.
5. Het Eindoordeel
Het paper concludeert dat hoewel AI (specifiek GPT-4) een zeer capabele tool wordt voor onderhandelingsonderzoek, het nog geen perfecte onderhandelaar is.
- Het is geweldig in: Het volgen van regels, het doen van wiskunde en het begrijpen van de structuur van een gesprek.
- Het is nog volop aan het leren: Het begrijpen van menselijke emoties, strategisch eigenzinnig zijn (op een goede manier) en niet in de war raken door lange gesprekken.
De onderzoekers suggereren dat AI voorlopig het beste kan worden gebruikt als een hulpmiddel om gegevens te analyseren of mensen te trainen, in plaats van als een volledig autonome onderhandelaar die een mens in een belangrijke deal kan vervangen. Het is een krachtige assistent, maar er is nog steeds een mens nodig om het "sociale" werk te controleren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.