← Nieuwste papers
🤖 AI

TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate

Dit artikel introduceert Terms-Bench, een Bayesiaans spel-framework dat de evaluatie van onderhandelingen transformeert van geaggregeerde deal-rate ranglijsten naar bruikbare diagnostische analyse door een bekende tegenpartij-simulator te gebruiken om specifieke tekortkomingen van agenten in surplusextractie, geloofskalibratie en strategische naleving aan te wijzen.

Oorspronkelijke auteurs: Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet, Susan Athey, Jiashuo Liu, James Zou

Gepubliceerd 2026-06-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet, Susan Athey, Jiashuo Liu, James Zou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een meesteronderhandelaar wordt. In het verleden testten onderzoekers deze robots door ze te laten onderhandelen met andere robots. Ze keken dan alleen naar het eindresultaat: "Hebben ze een deal gesloten? Ja of Nee?"

Het probleem met deze aanpak is vergelijkbaar met het beoordelen van een chef-kok enkel op basis van het feit of de klant de maaltijd heeft opgegeten, zonder de maaltijd te proeven. Als de robot een deal sloot, maar alle winst weggeefde omdat hij te bang was om een eerlijke prijs te vragen, zou de oude test nog steeds zeggen: "Goed gedaan! Deal gesloten!" Het miste het feit dat de robot eigenlijk verschrikkelijk was in het strategische deel van de baan.

Dit artikel introduceert een nieuwe, slimmere manier om deze AI-onderhandelaars te testen, genaamd TERMS-BENCH. Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Gescripte Tegenstander" (De Omgeving als Verifieerder)

In de oude tests onderhandelde de robot tegen een andere "black box" AI. Je wist niet wat die andere AI dacht, dus je kon niet weten of jouw robot faalde omdat hij slecht was, of omdat de andere AI vreemd deed.

In TERMS-BENCH hebben de onderzoekers een gesimuleerde tegenstander gecreëerd die lijkt op een strikte, voorspelbare acteur die een verborgen script volgt.

  • Het Script: De tegenstander heeft een geheime "reservatieprijs" (de laagste prijs waarvoor hij wil verkopen of de hoogste prijs waarvoor hij wil kopen), een "urgentieniveau" (hoeveel tijdsdruk hij voelt) en een "persoonlijkheid" (agressief, vriendelijk of neutraal).
  • De Twist: De AI-agent weet deze geheimen niet. Hij moet ze raden op basis van wat de tegenstander zegt en doet.
  • De Verifieerder: De onderzoekers weten de geheimen wel. Omdat zij het script kennen, kunnen zij de prestaties van de AI beoordelen en precies zeggen waarom deze faalde. Faalde het omdat de AI de prijs van de tegenstander niet kon raden? Faalde het omdat de AI in de war raakte door de vriendelijke toon van de tegenstander? Of maakte de AI gewoon een slechte zet, zelfs terwijl hij het juiste antwoord wist?

2. De "Zes Persoonlijkheidstypen" van Tegenstanders

Om de AI echt te testen, gebruikten de onderzoekers niet zomaan één type tegenstander. Ze creëerden zes verschillende "families" van tegenstanders, zoals verschillende personages in een videogame:

  • De Eerlijke (Candid): Zegt precies wat hij bedoelt. Als hij vriendelijk is, gedraagt hij zich vriendelijk.
  • De Stille (Taciturn): Heeft dezelfde economische regels als de Eerlijke, maar zegt heel weinig. Het test of de AI dingen kan uitzoeken zonder hints.
  • De Reactieve (Expressive): Verandert zijn gedrag op basis van hoe de AI handelt. Als de AI pushend is, duwt deze tegenstander harder terug.
  • De Strateeg (Strategic): Gedraagt zich als de Reactieve, maar verbergt zijn ware gevoelens in zijn woorden. Het is een meester in vermommingen.
  • De Chaotische (Stochastic): Gooit willekeurige ruis en verwarrende signalen erin om te zien of de AI in paniek raakt.
  • De Bully (Adversarial): Probeert de AI altijd te intimideren.
    Door de AI tegen al deze verschillende "personages" te testen, kunnen de onderzoekers precies aanwijzen welke vaardigheid de AI mist.

3. De "Magische Bril" (Oracle Interventies)

Dit is het meest vernuftige deel van het artikel. Soms faalt een AI, maar weten we niet of dat komt omdat hij dom is (kan de tegenstander niet begrijpen) of onhandig (weet het juiste antwoord, maar maakt een slechte zet).

De onderzoekers gebruiken een "magische bril"-truc:

  1. Basistest: De AI onderhandelt normaal, waarbij hij de geheimen van de tegenstander probeert te raden.
  2. De "Posterior" Bril: Ze geven de AI een spiekbriefje dat zegt: "Hier is de exacte waarschijnlijkheid van wat de tegenstander denkt." Als de AI dan nog steeds faalt, betekent dit dat hij slecht is in het handelen op informatie, en niet in het verkrijgen ervan.
  3. De "Revealed Type" Bril: Ze vertellen de AI de exacte geheime prijs en persoonlijkheid van de tegenstander. Als de AI dan nog steeds geen goede deal sluit, betekent dit dat de AI verschrikkelijk is in het maken van de juiste zetten, zelfs met perfecte informatie.

Hierdoor kunnen ze het falen opdelen in drie delen:

  • Inference Failure (Afleidingsfout): "Je kon de prijs van de tegenstander niet raden."
  • Uncertainty Failure (Onzekerheidsfout): "Zelfs met een goede gok, was je te onzeker om te handelen."
  • Control Failure (Controlefout): "Je wist het juiste antwoord, maar je maakte een onhandige zet."

4. Wat ze vonden

Toen ze 13 van de slimste beschikbare AI-modellen testten (zoals Claude, GPT-5 en Gemini), ontdekten ze enkele verrassende zaken:

  • De "Deal Rate" Leugen: Bijna alle AI's waren erg goed in het sluiten van een deal (95%+ succespercentage). Maar de oude tests stopten daar.
  • De Werkelijke Kloof: Wanneer ze keken naar hoeveel winst de AI maakte, liepen de resultaten volledig uiteen. Sommige modellen maakten geweldige deals; anderen sloten een deal, maar gaven bijna al het geld weg.
  • De "Cue" Valstrik: Veel AI's werden in de war gebracht door de toon van de tegenstander. Als de tegenstander vriendelijk klonk of druk uitoefende, gaf de AI vaak te veel geld op, zelfs als de wiskunde zei dat dat niet moest.
  • Verschillende Bottlenecks: Sommige AI's waren slecht in het raden van de geest van de tegenstander. Anderen waren erg goed in het raden, maar slecht in het maken van de uiteindelijke zet.

De Kernboodschap

Het artikel betoogt dat we moeten stoppen met alleen het tellen van "gesloten deals" en moeten beginnen met het diagnosticeren van hoe de deal tot stand kwam. TERMS-BENCH is als een medische scan voor AI-onderhandelaars. In plaats van alleen te zeggen "Patiënt is gezond" (Deal Gesloten), vertelt het je precies welk orgaan faalt (bijv. "De AI is slecht in het lezen van emotionele signalen" of "De AI kan niet omgaan met tijdsdruk").

Dit helpt ontwikkelaars om precies te weten wat ze moeten repareren: Moeten ze de AI trainen om minder emotioneel te zijn? Moeten ze de AI leren om druk te negeren? Of moeten ze de AI leren om dapperere zetten te doen? Het verandert een simpele ranglijst in een gedetailleerde handleiding voor het bouwen van betere AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →