← Nieuwste papers
🤖 AI

Faithful Mobile GUI Agents with Guided Advantage Estimator

Dit artikel introduceert Faithful-Agent, een tweefasenframework dat de betrouwbaarheid van visueel-taal GUI-agenten verbetert door bewijsgebaseerde supervised fine-tuning te combineren met een geleide advantage-estimator (GuAE) om hallucinaties aanzienlijk te verminderen en de succespercentages van taken te verhogen, terwijl de algemene vaardigheden voor het volgen van instructies behouden blijven.

Oorspronkelijke auteurs: Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed gelezen robotassistent hebt die naar je phonescherm kan kijken en je instructies kan volgen, zoals "Koop een iPhone 17 voor me" of "Reset mijn wachtwoord". Deze robot gebruikt een krachtige hersenen (een Vision-Language Model) om te begrijpen wat het ziet en wat je zegt.

Echter, het artikel wijst op een groot gebrek: deze robot is vaak een "zeker leugenaar".

Het Probleem: De Robot die Gist in plaats van Kijkt

De auteurs noemen dit gedrag "ontrouw". Zo ziet dat er in het echte leven uit:

  1. De "Geheugen"-Valstrik: Stel je voor dat je de robot vraagt om "Je wachtwoord te resetten". De robot ziet een scherm dat eigenlijk leeg is of bedekt door een pop-up advertentie. In plaats van te zeggen: "Ik kan de knop niet zien", herinnert de robot zich dat meestal de reset-knop rechtsboven staat. Het klikt daar blindelings, zelfs al is de knop er niet. Het vertrouwt op een ingesleten afkorting in plaats van naar het feitelijke bewijs te kijken.
  2. De "Droom"-Valstrik: Stel je voor dat je de robot vraagt om "Een iPhone te kopen op Amazon", maar het scherm toont momenteel Apple Music. De robot negeert het feit dat het in de verkeerde app zit en blijft proberen de telefoon binnen de muziekapp te kopen. Het dwaalt af van je werkelijke instructie omdat het niet oplet naar de context.

De robot "hallucineert" in feite zijn weg door taken, en gist wat er zou moeten zijn in plaats van te controleren wat er is.

De Oplossing: "Faithful-Agent"

De onderzoekers hebben een nieuwe trainingsmethode ontwikkeld die Faithful-Agent heet. Denk hierbij aan een strenge coach die de robot een nieuwe regel leert: "Als je het niet kunt zien, raak het niet aan."

De training vindt plaats in twee fasen, net als het leren autorijden:

Fase 1: De "Stop en Denk"-Les (SFT)

Eerst leren ze de robot om af te zien.

  • De Analogie: Stel je een student voor die een toets maakt. Als ze het antwoord niet weten, kan een normale student wild gokken. Een "trouwe" student wordt geleerd om de hand op te steken en te zeggen: "Ik heb niet genoeg informatie om dit te beantwoorden."
  • Hoe het werkt: De robot wordt getraind om te herkennen wanneer het scherm geblokkeerd, verwarrend is, of niet overeenkomt met de instructie. In plaats van te gokken, leert het op "Terug" te drukken, naar "Home" te gaan, of de taak volledig te stoppen. Dit voorkomt dat het wilde, ongegronde gokken maakt.

Fase 2: De "Slimme Coach" (RFT met GuAE)

Dit is het technischste deel, maar hier is de eenvoudige versie.
De robot leert door veel verschillende acties te proberen en te zien welke een "beloning" (een goede score) oplevert. Maar in de echte wereld zijn beloningen vaak schaars (je krijgt alleen een beloning als je de hele taak afrondt) en binair (je hebt het goed of fout; er is geen "bijna goed").

  • Het Probleem: Wanneer de robot 8 verschillende gokken probeert en ze lijken allemaal "fout" (of allemaal "goed"), raakt het trainingssysteem in de war. Het kan niet vertellen welke gok iets beter was omdat ze allemaal hetzelfde lijken. De auteurs noemen dit "Advantage Collapse". Het is alsof een leraar een klas moet beoordelen waar elke student een 50/50 haalde; de leraar kan niet uitzoeken wie meer hulp nodig heeft.
  • De Oplossing (GuAE): De onderzoekers hebben een nieuwe "Guided Advantage Estimator" (GuAE) uitgevonden.
    • De Analogie: Stel je een coach voor die weigert de prestatiescore van het team tot nul te laten zakken alleen omdat iedereen vergelijkbaar speelde. De coach voegt een "veiligheidsanker" toe aan het scoresysteem. Zelfs als het team vastzit in een sleur, zorgt de coach ervoor dat er nog steeds een klein, duidelijk signaal is dat de spelers vertelt: "Blijf proberen, maar wees voorzichtiger."
    • Dit voorkomt dat de robot vastloopt in een lus waar het stopt met leren omdat de feedback te vlak lijkt.

De Resultaten

Het artikel testte deze nieuwe robot tegen andere robots op een "Trap"-dataset (scenario's ontworpen om de robot te bedriegen, zoals verborgen knoppen of verkeerde apps).

  • Voorheen: De oude robots faalden in deze valstrikken ongeveer 86% van de tijd (het Succespercentage was slechts ~14%). Ze bleven gokken en falen.
  • Na: De Faithful-Agent slaagde in deze valstrikken 80% van de tijd.

Meest belangrijk is dat de robot zijn vermogen om normale taken uit te voeren niet verloor. Het werd betrouwbaarder zonder "dom" of overdreven voorzichtig te worden. Het leerde zeggen: "Ik kan dit nu niet doen," in plaats van het systeem te laten crashen met een verkeerde gok.

Samenvatting

Het artikel introduceert een manier om AI-agenten te trainen om te stoppen met gokken wanneer het bewijs ontbreekt. Door hen te leren om te stoppen en terug te trekken wanneer dingen er verkeerd uitzien, en door een slimmer scoresysteem te gebruiken om ze aan het leren te houden zelfs als de feedback vaag is, wordt de robot veel betrouwbaarder en minder geneigd om zijn eigen werkelijkheid te verzinnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →