Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment
Deze studie toont aan dat de keuze van het LLM en de conversationele context een significante impact hebben op de semantische consistentie van gegenereerde antwoorden, wat suggereert dat huidige prompting-strategieën onvoldoende zijn om stabiele, vergelijkbare reacties over verschillende modellen heen te waarborgen in gesprek-gebaseerde beoordelingen.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de moderne wereld van het onderwijs is het meten van hoe goed mensen communiceren en samenwerken al lang een hardnekkig probleem. In tegen tegenstelling tot een wiskundetoets, waarbij één getal bewijst dat een student het antwoord weet, vinden vaardigheden zoals samenwerking plaats in de rommelige, vloeiende interactie van een gesprek. Om dit eerlijk te meten, moeten onderwijzers ervoor zorgen dat elke student voor een vergelijkbare uitdaging wordt gesteld, zelfs als het gesprek een ander pad inslaat. Recentelijk heeft kunstmatige intelligentie een nieuwe manier geboden om dit op te lossen. Door computerprogramma's te gebruiken die kunnen praten en luisteren, kunnen scholen virtuele partners creëren waarmee studenten kunnen oefenen. Deze programma's kunnen zich aanpassen aan wat een student zegt, waardoor een natuurlijk gesprek ontstaat dat onthult hoe goed de student denkt en samenwerkt. Er is echter een stille zorg gegroeid onder experts: als het computerprogramma verandert, verandert het gesprek dan ook? Als een student vandaag een test aflegt met één versie van de software en een andere student volgend jaar met een nieuwere versie, zullen zij dan op dezelfde manier naar dezelfde vragen antwoorden? Deze vraag raakt de kern van rechtvaardigheid. Als de reacties van de computer sterk verschuiven afhankelijk van welke versie van het model wordt gebruikt, kan de test stoppen met het meten van de bekwaamheid van de student en in plaats daarvan de eigenaardigheden van de software gaan meten.
Een onderzoeker bij de Educational Testing Service zette zich in om precies dit probleem te onderzoeken. Hij wilde weten of de betekenis van een reactie van een computer hetzelfde blijft wanneer de onderliggende software verandert. Om dit te ontdekken, heeft hij geen verzonnen gesprekken bedacht. In plaats daarvan nam hij echte berichten uit eerdere online wetenschappelijke projecten waar twee mensen samenwerkten om problemen op te lossen. Hij selecteerde 61 specifieke momenten uit deze chats waar één persoon iets belangrijks had gezegd en de ander een duidelijke, behulpzame reactie had gegeven. De onderzoeker vroeg vervolgens aan vier verschillende versies van een groot taalmodel — een type kunstmatige intelligentie dat is ontworpen om menselijke taal te begrijpen en te genereren — om op diezelfde 61 berichten te reageren. Hij voerde dit experiment twee keer uit voor elk bericht. In de eerste ronde zag de computer alleen het enkele bericht dat het moest beantwoorden. In de tweede ronde zag het de melding plus de volledige geschiedenis van het gesprek dat eraan voorafging. Voor elk enkel bericht genereerde elk computermodel 100 verschillende reacties om te zien hoeveel de antwoorden varieerden.
De resultaten toonden aan dat zowel de keuze van het computermodel als de context van het gesprek de gelijkenis van de reacties beïnvloeden. Wanneer de onderzoeker de 100 door een enkel model gegenereerde reacties vergeleek, stelde hij vast dat de antwoorden vrij vergelijkbaar waren, met gelijkenisscores variërend van 0,715 tot 0,795. Maar wanneer hij de reacties van het ene model vergeleek met de reacties van een ander model, daalde de gelijkenis aanzienlijk. Het was alsof elk model zijn eigen unieke stem en manier van denken had. Het effect van het toevoegen van de gesprekshistorie hing af van het specifieke gebruikte model; in sommige gevallen zorgde het opnemen van de chatgeschiedenis voor een lichte verbetering van de afstemming van de reacties op menselijke reacties, maar het zorgde er niet in alle gevallen voor dat de modellen meer met elkaar overeenstemden. De studie vond ook dat nieuwere modellen uit dezelfde softwarefamilie de neiging hadden om meer gelijnbare antwoorden aan elkaar te produceren dan aan oudere, andere modellen. Dit suggereert dat de "stamboom" van de software een belangrijke rol speelt in hoe het gedrag vertoont naast de specifieke instructies die eraan worden gegeven.
Misschien wel het belangrijkste is dat de onderzoeker ontdekte dat het vertrouwen op alleen prompting en de context van het gesprek niet voldoende kan zijn om een zeer gelijkmatige reactiegedrag te garanderen wanneer het onderliggende LLM verandert. Zelfs wanneer de modellen exact dezelfde prompt en dezelfde gesprekshistorie kregen, leidde de keuze van het model nog steeds tot significante verschillen in de semantische inhoud van de reacties. De studie suggereert dat het vertrouwen op de natuurlijke flexibiliteit van deze kunstmatige intelligentiesystemen riskant is voor toetsing met een hoge inzet. Als een test vertrouwt op de computer om het gesprek op koers te houden, en de computer zijn stijl elke keer dat hij wordt bijgewerkt verandert, kunnen de testresultaten onbetrouwbaar worden. De onderzoeker concludeerde dat om een eerlijk testsysteem te bouien dat standhoudt, zij niet simpelweg kunnen vertrouwen op de software om uit zichzelf het juiste te doen. In plaats daarvan moeten zij extra lagen van controle inbouwen in het systeem — zoals regels of sjablonen — die ervoor zorgen dat de reacties van de computer binnen een veilige, consistente marge blijven, ongeacht welke versie van de software eronder draait. Zonder deze waarborgen zou de snelle evolutie van kunstmatige intelligentie de rechtvaardigheid die het onderwijstestwezen probeert te beschermen, kunnen ondermijnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.