Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task
Dit artikel toont aan dat hoewel Large Language Models uitblinken in de gestructureerde, intentionele interpretatie van persoonlijke relaties vergeleken met mensen, zij onderpresteren in de referentiële, extensionele taak, wat suggereert dat een gebrek aan referentiële gronding een kritieke beperking is in hun vermogen om mensachtige taalbegrip te bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gigantische, complexe stamboom hebt van zes mensen: Amber, Bryan, Christina en Dana. Ze zijn allemaal verbonden door relaties zoals "vriend", "vijand", "ouder" en "kind".
Stel je nu voor dat iemand een lastige vraag over deze stamboom stelt, zoals: "Wie is de vriend van de ouder van Amber?"
Dit artikel is een head-to-head competitie tussen mensen en AI-taalmodellen (LLM's) om te zien wie beter is in het beantwoorden van deze vraag. Maar hier komt de twist: de onderzoekers vroegen de deelnemers om het probleem op twee totaal verschillende manieren op te lossen.
De twee manieren om de puzzel op te lossen
Het "Wie is het?" spel (Extensionele taak):
- Het doel: Geef alleen de naam van de persoon.
- Het antwoord: "Felicia."
- Wat het test: Kun je de kaart navigeren en de specifieke bestemming vinden? Dit is als kijken naar een kaart en naar de stad wijzen die je moet bezoeken.
Het "Hoe kom ik daar?" spel (Intensionele taak):
- Het doel: Geef niet de naam. Schrijf in plaats daarvan het recept of de formule op om de persoon te vinden.
- Het antwoord:
friend(parent(Amber)) - Wat het test: Kun je de structuur van de zin begrijpen en de stappen opschrijven? Dit is als het opschrijven van de rijrichtingen zonder daadwerkelijk de auto te besturen.
De grote verrassing: Mensen en AI zijn elkaars tegenpolen
De onderzoekers ontdekten dat mensen en AI heel andere dingen goed doen. Het is also kind met het vergelijken van een menselijke navigator met een supersnelle vertaler.
Mensen zijn de Navigatoren:
Wanneer gevraagd werd "Wie is het?", waren mensen er erg goed in (83% nauwkeurigheid). Ze konden naar de stamboom kijken, de verbindingen volgen en de juiste persoon aanwijzen.
Echter, wanneer gevraagd werd om het "recept" te schrijven (friend(parent(Amber))), hadden mensen moeite (71% nauwkeurigheid). Het is alsof je een geweldige chauffeur bent die plotseling een tekstboek over hoe je moet rijden moet schrijven, maar de specifieke regels voor het opschrijven ervan vergeet.AI is de Super-Vertaler:
Wanneer gevraagd werd om het "recept" te schrijven, was de AI verbazingwekkend goed (95% nauwkeurigheid). De AI behandelde de vraag als een taalpuzzel. De AI zag "de vriend van de ouder van Amber" en herschikte de woorden simpelweg tot een formule. Het is als een vertaler die perfect Frans naar Engels kan converteren, maar zelf nooit in Frankrijk is geweest.
Echter, wanneer gevraagd werd "Wie is het?", raakte de AI in de war (80% nauwkeurigheid). De AI had moeite om de stamboom daadwerkelijk te gebruiken om de specifieke persoon te vinden. De AI kende het recept, maar kon het niet volgen naar de bestemming.
Waarom gebeurt dit?
Het artikel suggereert een eenvoudige reden: waar ze hun vaardigheden hebben geleerd.
- Mensen leren taal door interactie met de echte wereld. Wij weten wat een "vriend" of een "ouder" is omdat we ze hebben ontmoet. Wij zijn geworteld in de realiteit. Dus het vinden van een specifieke persoon (de "wie") komt natuurlijk voor ons.
- AI leert alleen van tekst. De AI heeft nooit een persoon genaamd Amber ontmoet. De AI heeft alleen miljoenen zinnen over vrienden en ouders gezien. Het is een expert in het herkennen van patronen in woorden en het herschikken daarvan (vertaling), maar het heeft geen "echte wereld" kaart om doorheen te navigeren. Het is als een chef die elk kookboek ter wereld heeft gelezen, maar nog nooit een maaltijd heeft bereid of ingrediënten heeft geproefd.
De "Abstracte" Twist
De onderzoekers probeerden ook een moeilijkere versie waarbij ze namen zoals "Amber" vervingen door willekeurige letters zoals "h" en "vriend" door "x".
- Mensen vonden dit verschrikkelijk. Het was erg moeilijk voor hen om het recept met willekeurige letters te achterhalen.
- AI was nog steeds redelijk goed in het recept-gedeelte, maar werd erg slecht in het vinden van de persoon.
De Conclusie
Het artikel concludeert dat hoewel AI ongelooflijk slim is in het manipuleren van symbolen en het schrijven van formules (de "Intensionele" taak), het nog niet zo goed is als mensen in het gebruiken van die symbolen om echte wereldantwoorden te vinden (de "Extensionele" taak).
De auteurs betogen dat voor AI om taal te begrijpen zoals een mens, het meer nodig heeft dan alleen het lezen van boeken; het moet "gegrond" zijn in de echte wereld, net zoals wij dat zijn. Tot die tijd is AI een briljante vertaler van ideeën, maar nog geen perfecte navigator van de realiteit.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.