← Nieuwste papers
💬 NLP

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

Dit artikel introduceert LoSoNA, een benchmark die is ontworpen om het vermogen van op LLM gebaseerde agenten te evalueren om impliciete lokale sociale normen in groepschats met meerdere deelnemers af te leiden en zich daaraan aan te passen, waarbij wordt onthuld dat hoewel expliciete prompting de prestaties voor topmodellen zoals Gemini 3.1 Pro en Claude Fable 5 verbetert, de meeste modellen nog steeds moeite hebben met deze taak onder naïeve prompting.

Oorspronkelijke auteurs: Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe groep vrienden binnenloopt bij een koffiebar. Je kent hen niet, maar je hoort hen praten. Na een paar minuten merk je een patroon op: wanneer iemand slecht nieuws deelt, biedt de groep geen knuffels of woorden als "Wat erg voor je" aan. In plaats daarvan vragen ze onmiddellijk: "Wat is het plan om het op te lossen?" of "Heb je de handleiding al gecheckt?"

Als je zou inspringen en een warm, generiek "Wat vervelend om te horen" zou bieden, zou je je ongemakkelijk kunnen voelen omdat je de ongeschreven regel van de groep hebt gemist. Dit paper, LoSoNA, is een test om te zien of AI-chatbots deze verborgen regels kunnen ontdekken door simpelweg te luisteren, zonder dat ze expliciet zijn verteld wat de regels zijn.

Hier is een uitsplitsing van de belangrijkste punten van het paper met behulp van eenvoudige analogieën:

1. Het Probleem: Het "Ongeschreven Regelboek"

In het echte leven heeft elke groep zijn eigen "lokale sociale normen". Dit zijn de ongeschreven regels over hoe je handelt, spreedt en reageert.

  • De bewering van het paper: De meeste AI-modellen zijn als beleefde toeristen die altijd het "standaard" beleefde ding zeggen (zoals een generiek "Het spijt me"). Ze hebben moeite om te merken wanneer een specifieke groep een andere, verborgen regel heeft (zoals "geef alleen praktisch advies").
  • Het doel: De onderzoekers wilden zien of een AI als een lokale bewoner kon handelen in plaats van als een toerist. Kon de AI naar de geschiedenis van de groep luisteren, de verborgen regel ontdekken en de gedragingen aanpassen om erbij te passen?

2. De Test: Het "Mysteriefeestje"

De onderzoekers hebben een benchmark gecreëerd genaamd LoSoNA (Local Social Norm Adaptation). Zie het als een mysterieus feestspel voor AI.

  • De Opzet: De AI krijgt een transcript (een chatlog) van een groepsgesprek. De andere mensen in de chat volgen een geheime regel (bijv. "We gebruiken nooit emoji's" of "We antwoorden alleen met 'Ja' of 'Nee'").
  • De Valstrik: De AI wordt niet verteld wat de regel is. De AI ziet alleen de chat.
  • De Uitdaging: De chat eindigt met een vraag (de "elicitor"). De AI moet reageren.
    • Als de AI een generiek, beleefd antwoord geeft, faalt hij (omdat hij de regel niet heeft opgemerkt).
    • Als de AI een antwoord geeft dat overeenkomt met de vreemde, verborgen stijl van de groep, wint hij.

Analogie: Stel je voor dat je op een dinerfeest bent waar iedereen met de handen eet, maar niemand er een woord over zegt. Als je een vork pakt omdat je geleerd hebt wat "goed manieren" zijn, slaag je niet voor de test. Als je merkt dat iedereen met de handen eet en je hetzelfde doet, slaag je wel.

3. Het Experiment: Het Proberen van Verschillende "Hints"

De onderzoekers testten 8 verschillende AI-modellen (zoals GPT-5.5, Claude, Gemini, etc.) onder vier verschillende "instructie"-scenario's om te zien hoe ze presteerden:

  1. Naïef: "Reageer gewoon op het laatste bericht." (Geen hints).
  2. Alleen Elicitor: "Reageer alleen op het laatste bericht, negeer de rest."
  3. Stijladaptatie: "Probeer de toon en stijl van de groep te matchen."
  4. Norm-geïnformeerd: "Er is mogelijk een verborgen patroon of regel in deze chat. Probeer het te vinden en volg het op."

4. De Resultaten: Sommige AI's Haalden Het, Anderen Niet

De resultaten waren een mix van "goed gedaan" en "nog steeds aan het leren".

  • De Strijd: Wanneer ze geen hints kregen (Naïef), faalden de meeste AI-modellen jammerlijk. Ze bleven generieke, beleefde antwoorden geven die de verborgen regels van de groep braken. Het was alsof de AI een blinddoek droeg.
  • De Doorbraak: Wanneer de onderzoekers de "Norm-geïnformeerde" hint gaven (de AI vertelden om naar een patroon te zoeken), werden sommige modellen plotseling erg goed in dit werk.
    • Gemini 3.1 Pro en Claude Fable 5 werden de "kampioenen"; ze sprongen van falen naar het goed hebben van ongeveer 80-84% van de antwoorden. Ze waren als studenten die, zodra ze te horen kregen "zoek naar het patroon", direct het puzzelstukje konden oplossen.
    • Andere Modellen: Sommige modellen (zoals Mistral) werden zelfs slechter wanneer ze de hint kregen. Het is alsof de hint hen in de war bracht, waardoor ze te veel gingen nadenken en fouten maakten in antwoorden die ze standaard wel goed hadden gekregen.

5. Wat Dit Betekent (en Wat Het Niet Betekent)

  • Wat het bewijst: Het paper laat zien dat AI kan leren zich aan te passen aan lokale groepsgedragingen als je het de juiste duwt geeft. Het bewijst dat AI niet alleen een robot is die altijd hetzelfde beleefde ding zegt; het kan een "kameleon" zijn die zijn gedrag aanpast aan de menigte.
  • Wat het niet bewijst: Het paper is zeer voorzichtig in de opmerking dat dit een beperkte test is. Het betekent niet dat de AI "sociaal intelligent" is in de menselijke zin, of dat het diepe menselijke emoties begrijpt. Het betekent alleen dat de AI een patroon in een chatlog kan herkennen en dit kan kopiëren voor één enkele reactie.
  • De Beperking: De test gebruikt verzonnen chatscenario's, geen echte menselijke gesprekken. Ook kijelt de test slechts naar één enkele reactie, niet naar een langdurige vriendschap.

Samenvatting

LoSoNA is een rapportcijfer voor AI op het vermogen om "de kamer te lezen" (de sfeer te proeven).

  • Zonder hulp: De meeste AI's zijn ongevoelig voor de toon en houden vast aan hun standaard beleefde scripts.
  • Met een hint: De slimste AI's kunnen de geheime handdruk van de groep ontdekken en er perfect bij passen.
  • De kernboodschap: We komen dichter bij AI die kan opgaan in menselijke groepen, maar het heeft nog steeds een beetje begeleiding nodig om te stoen met een "robot-toerist" en te beginnen als een "local" te handelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →