← Nieuwste papers
💻 computer science

Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning

Het artikel introduceert HyperClick, een nieuw kader dat gebruikmaakt van zelfgecritiseerd versterkend leren om tegelijkertijd de nauwkeurigheid van GUI-gronding en de afstemming van vertrouwen te optimaliseren, waardoor betrouwbaardere en meer betrouwbare autonome GUI-agenten mogelijk worden.

Oorspronkelijke auteurs: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, maar iets te zelfverzekerde robotassistent voor. Zijn taak is om naar je telefoon- of computerscherm te kijken en precies daar te klikken waar je hem zegt te klikken. Als je zegt: "Klik op de knop Privacy", moet de robot die knop vinden en erop tikken.

Het probleem is dat deze robot vaak denkt een genie te zijn, zelfs als hij het fout heeft. Hij klikt misschien op de verkeerde plek, maar vertelt je dan vol overtuiging: "Ik ben 99% zeker dat dit de juiste knop is!" Dit is gevaarlijk, want als de robot fout is maar zelfverzekerd, kan hij op het verkeerde ding klikken, waardoor een fout ontstaat die je hele taak verpest.

Dit artikel introduceert een nieuwe trainingsmethode genaamd HyperClick om dit op te lossen. Hieronder wordt uitgelegd hoe het werkt, met behulp van enkele eenvoudige analogieën:

Het probleem: De "te zelfverzekerde student"

Beschouw huidige AI-modellen als een student die een toets maakt. Ze beantwoorden elke vraag, maar geven vaak een fout antwoord terwijl ze roepen: "Ik ben absoluut zeker dat ik gelijk heb!"

  • Het probleem: De onderzoekers ontdekten dat deze AI-modellen slecht zijn in het weten wanneer ze het niet weten. Ze zijn "te zelfverzekerd". Als ze het fout hebben, zeggen ze nog steeds dat ze 90% zeker zijn. Dit maakt het voor mensen moeilijk om hen te vertrouwen of te weten wanneer ze moeten ingrijpen en helpen.

De oplossing: "Zelfkritiek" met een dubbele beloning

De auteurs hebben een nieuw systeem ontwikkeld genaamd HyperClick dat de robot leert eerlijk te zijn over zijn eigen vertrouwen. Ze gebruikten een techniek genaamd Zelfgecritiseerde Versterkende Leer (SCRL).

Stel je een leraar voor die een student traint met twee specifieke regels (beloningen):

  1. De "Heb je het doel geraakt?"-beloning:

    • Als de robot op de juiste knop klikt, krijgt hij een punt. Als hij op de verkeerde klikt, krijgt hij nul. Dit is de standaardmanier om robots te trainen.
    • Analogie: Dit is als een basketbalcoach die zegt: "Als de bal in de ring gaat, krijg je een punt."
  2. De "Eerlijkheid"-beloning (het nieuwe deel):

    • Dit is het magische ingrediënt. De robot moet nu zeggen hoe zeker hij is voordat hij klikt.
    • Als de robot op de juiste plek klikt, moet hij zeggen: "Ik ben erg zeker (hoog vertrouwen)."
    • Als de robot op de verkeerde plek klikt, moet hij zeggen: "Ik ben niet erg zeker (laag vertrouwen)."
    • De draai: Als de robot op de verkeerde plek klikt maar zegt: "Ik ben 100% zeker!", wordt hij gestraft. Als hij op de juiste plek klikt maar zegt: "Ik gok maar", krijgt hij ook een lagere score.
    • Analogie: De leraar zegt nu: "Je krijgt alleen volledige punten als je vertrouwen overeenkomt met je prestatie. Als je de worp mist, moet je toegeven dat je aan het gokken was. Als je de worp maakt, mag je zeggen dat je zeker was."

Hoe het in de praktijk werkt

Het systeem maakt een "vertrouwenskarte" voor elk scherm.

  • Het doel: Stel je voor dat de juiste knop een bullseye is. Het midden van de bullseye staat voor "100% vertrouwen". Naarmate je je van het midden verwijdert, daalt de vertrouwensscore.
  • De training: De robot leert om naar zijn eigen klik te kijken. Als hij dicht bij het midden klikt, leert hij te zeggen: "Hoog vertrouwen!" Als hij ver weg klikt, leert hij te zeggen: "Laag vertrouwen."

De resultaten

De onderzoekers testten dit op veel moeilijke schermen (zoals hoogresolutie computerinterfaces en mobiele apps).

  • Nauwkeurigheid: De robot gaf nog steeds even vaak het juiste antwoord als de beste bestaande robots.
  • Eerlijkheid: De grote winst was dat de robot veel beter werd in het laten overeenkomen van zijn vertrouwen met zijn daadwerkelijke prestatie.
    • Voorheen: Hij had het fout maar zei dat hij 90% zeker was.
    • Daarna: Als hij het fout heeft, geeft hij toe: "Ik ben maar 40% zeker." Als hij het goed heeft, zegt hij: "Ik ben 90% zeker."

Waarom dit belangrijk is

Dit betekent niet dat de robot nog perfect is, maar het maakt hem betrouwbaar.

  • De "onthoud"-functie: Omdat de robot nu kan zeggen: "Ik ben niet zeker van deze klik", kan een mens (of een veiligheidssysteem) ingrijpen en zeggen: "Oké, klik daar nog niet op, laat me het controleren."
  • Geen blind vertrouwen meer: In plaats van blind te vertrouwen op een robot die misschien zelfverzekerd fout is, kun je nu vertrouwen op zijn onzekerheid. Als hij zegt dat hij het niet zeker weet, weet je dat je voorzichtig moet zijn.

Samenvatting

Het artikel stelt HyperClick voor, een trainingsmethode die AI-schermklikkers leert eerlijk te zijn. Het dwingt de AI niet alleen om de juiste knop te vinden, maar ook om nauwkeurig te rapporteren hoe zeker hij is. Dit voorkomt dat de AI zelfverzekerd fouten maakt, waardoor het een veiligere en betrouwbaardere assistent wordt voor het automatiseren van je computer- en telefoontaken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →