Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception
Deze voorlopige studie introduceert het "Ghost-in-the-Loop"-framework om aan te tonen dat deelnemers vaak moeite hebben met het onderscheiden van menselijke en AI-agency bij humanoïde teleoperatie, waarbij hun oordelen primair worden gedreven door waargenomen natuurlijkheid en multimodale consistentie in plaats van de werkelijke bron van controle.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een toekomst voor waarin een robot die in je woonkamer staat niet slechts een machine is die een script volgt, maar een gesprekspartner die in staat is om te glimlachen, te gebaren en te reageren met de vloeiendheid van een mens. Deze visie rust op teleoperatie, een methode waarbij een persoon op afstand zit en de bewegingen en stem van de robot in realtime aanstuurt, waarbij de machine effectief als een extern lichaam wordt gebruikt. Jarenlang vereiste dit een menselijke operator die constant aanwezig moest zijn, wat beperkte hoeveel mensen één persoon kon helpen of hoe lang een gesprek kon duren. Echter, de snelle opkomst van kunstmatige intelligentie heeft een nieuwe mogelijkheid geïntroduceerd: systemen die zelfstandig spraak, gezichtsuitdrukkingen en gebaren kunnen genereren, waarbij ze de mens zo nauwgezet nabootsen dat het verschil moeilijk te onderscheiden is. Dit creëert een fascinerende en enigszins verontrustende vraag voor iedereen die met deze machines interageert: als een robot acteert, kun je dan zien of een echt persoon de touwtjes in handen heeft, of dat een algoritme het werk doet?
Onderzoekers van Sony Computer Science Laboratories en de Universiteit van Tokio zetten zich in om deze vraag te beantwoorden door een systeem te bou�its dat zij Ghost-in-the-Loop noemen. Dit framework stelt een humanoïde robot in staat om naadloos te schakelen tussen worden aangestuurd door een menselijke operator en volledig worden gedreven door kunstmatige intelligentie, terwijl de robot er exact hetzelfde uitziet en klinkt. De robot, een Unitree G1-model uitgerust met een scherm als gezicht en camera's om zijn omgeving te zien, dient als het podium. Wanneer een mens de controle heeft, draagt deze een headset om te zien wat de robot ziet en gebruikt hij bewegingssensoren om de handen en het gezicht van de robot te sturen. Wanneer het systeem overschakelt naar de AI-modus, luistert de robot naar het gesprek en gebruikt hij generatieve modellen om zijn eigen stem, gezichtsbewegingen en handgebaren te creëren, passend bij dezelfde visuele en auditieve stijl als de door een mens gecontroleerde versie. Het doel was niet om te zien welke beter was, maar om te zien of een menselijke waarnemer het verschil überhaupt kon zien.
Om dit te testen, creëerde het team een reeks korte videoclips waarin de robot in gesprek is. Ze namen acht verschillende interacties op, variërend van informele praatjes tot taakgerichte discussies, die elk tussen de vijf en veertig seconden duurden. In de helft van deze clips werd de robot aangestuurd door een menselijke teleoperator. In de andere helft genereerde het AI-systeem het gedrag. Cruciaal was dat de stem, het gezicht en het lichaam van de robot consistent bleven over alle clips, zodat de enige variabele de bron van de controle was. De onderzoekers nodigden vervolgens vijftig mensen uit om deze video's online te bekijken. Na elke clip werden de deelnemers gevraagd te beslissen of de robot door een mens of door een computer werd aangestuurd, waarbij ze hun zekerheid beoordeelden op een schaal die liep van min tien voor een definitieve AI tot plus tien voor een definitieve mens. Ze werden ook gevraagd uit te leggen waarom zij dat zo vonden.
De resultaten suggereren dat in deze korte momenten de lijn tussen mens en machine opmerkelijk vaag is. De deelnemers hadden aanzienlijke moeite om het onderscheid te maken tussen de twee bronnen van controle. Gemiddeld genomen verschoven hun beoordelingen nauwelijks tussen de door mensen gecontroleerde clips en de door AI aangestuurde clips; het verschil was zo klein dat het statistisch niet te onderscheiden was van willekeurige gokken. De studie geeft aan dat mensen bij korte interacties simpelweg niet betrouwbaar kunnen onderscheiden of een robot door een persoon of door een algoritme wordt bestuurd. Wanneer de onderzoekers keken naar wat de deelnemers daadwerkelijk dachten, kwam er een duidelijk patroon naar voren in hun verklaringen. Degenen die het gevoel hadden dat ze een oordeel konden vellen, vertrouwden zwaar op de algehele natuurlijkheid van het gedrag van de robot. Ze letten nauwlettend op de timing van het gesprek, het ritme van de bewegingen en of de stem, de gezichtsuitdrukking en de handgebaren in harmonie met elkaar leken te werken.
Wanneer de bewegingen van de robot stijf aanvoelden, de timing niet klopte, of de verschillende delen van het lichaam niet goed synchroon leken te lopen met de stem, waren deelnemers eerder geneigd te gokken dat het een AI was. Omgekeerd, wanneer de robot bewoog met een coherente flow, waarbij de gebaren en uitdrukkingen perfect pasten bij de spraak, waren mensen eerder geneigd te geloven dat er een mens achter de besturing zat. Dit betekent niet dat de AI perfect was, maar eerder dat de gebreken in de prestaties van de AI subtiel genoeg waren om in een vluchtige blik gemist te worden. De studie suggereert dat ons vermogen om agency (agentschap) te detecteren minder afhangt van de specifieke gebruikte technologie en meer van de consistentie van de uitvoering. Als de robot optreedt als een verenigd geheel, accepteert het brein het als een enkele entiteit, ongeacht of die entiteit van vlees of code is.
Dit voorlopige werk opent een nieuw hoofdstuk in hoe we de robots van de toekomst kunnen ontwerpen. Het impliceert dat we op de korte termijn wellicht niet hoeven te vrezen dat gebruikers tijdens korte uitwisselingen constant zullen twijfelen of een robot echt of nep is. In plaats daarvan kan de focus verschuiven naar hoe deze systemen menselijke en kunstmatige intelligentie kunnen laten versmelten, waarbij bijvoorbeeld een mens het overneemt wanneer een gesprek complexer wordt, terwijl de AI de routinematige delen afhandelt. De onderzoekers merken op dat hun bevindingen specifief zijn voor deze korte, gestructureerde clips en dat langere, complexere interacties andere patronen zouden kunnen onthullen. Voor nu bevestigt de studie dat wanneer een robot spreekt, glimlacht en beweegt met voldoende coherentie, de menselijke geest bereid is het als een partner te accepteren, waardoor de ware aard van de agency een stille mysterie blijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.