← Nieuwste papers
💬 NLP

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

Het paper introduceert VeriOS, een betrouwbaar OS-agent dat via een query-gedreven mens-agent-GUI-interactie proactief mensen raadpleegt in onbetrouwbare scenario's om over-executie te voorkomen, wat resulteert in een aanzienlijke verbetering van de succesratio zonder in te leveren op prestaties in normale situaties.

Oorspronkelijke auteurs: Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

Gepubliceerd 2026-04-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, digitale assistent hebt die je telefoon of computer voor je kan bedienen. Hij kan apps openen, berichten sturen en instellingen wijzigen. Dit is wat onderzoekers een "OS-agent" noemen.

Het probleem is echter: deze slimme assistent is soms te zelfverzekerd.

Het Probleem: De "Dwaze Chauffeur"

In de echte wereld gebeuren er rare dingen. Soms crasht je telefoon, verschijnt er een raar pop-up venster, of vraag jij iets vaags ("Doe maar iets met die foto").

De huidige slimme assistenten proberen in deze situaties gewoon door te gaan, alsof er niets aan de hand is. Het is alsof een chauffeur doorrijdt in een mistige bergweg terwijl hij denkt dat het een zonnige dag is. Hij raakt de afgrond in (hij doet iets verkeerd, zoals je locatie delen zonder dat je het wilt, of een app crashen).

De Oplossing: VeriOS – De "Voorzichtige Assistent"

De onderzoekers van dit paper hebben VeriOS bedacht. Dit is een nieuwe manier om te werken met die digitale assistent.

In plaats van blindelings door te gaan, leert VeriOS-agent om stopte tekenen te herkennen en om hulp te vragen.

Hier is hoe het werkt, met een paar creatieve vergelijkingen:

1. De Vraag-Antwoord Methode (De "Vragende Chef")

Stel je voor dat je een kok bent die een recept moet volgen.

  • De oude manier: De kok leest "Voeg zout toe" en gooit er een hele pot tegenaan, omdat hij niet zeker weet hoeveel.
  • De VeriOS-methode: De kok kijkt naar de situatie. Als hij ziet dat de pot leeg is of het recept vaag is, roept hij: "Chef, moet ik nu zout doen of peper?" Hij wacht op je antwoord voordat hij iets doet.

VeriOS doet precies dit. Als hij merkt dat de situatie "onveilig" of "onduidelijk" is (bijvoorbeeld een raar pop-up venster of een vaag commando), vraagt hij jou: "Ik zie een raar venster, wil je dat ik dit sluit of open?" Pas als jij antwoordt, voert hij de actie uit.

2. De Drie-Fase Training (Het "Schoolsysteem")

Hoe leer je een computer dit slimme gedrag? De onderzoekers gebruiken een slimme trainingsmethode die bestaat uit drie stappen, alsof je iemand leert autorijden:

  • Fase 1: Het Splitsen van Kennis (De "Meta-Kennis")
    Ze splitsen de leerstof in twee delen:

    1. Situatie-inzicht: "Is dit een normale weg of een gevaarlijke bocht?"
    2. Actie: "Hoe draai ik het stuur?"
      In plaats van alles door elkaar te leren, leren ze de assistent eerst om de situatie te herkennen, en daarna pas wat hij moet doen.
  • Fase 2: De "Wisselende" Training (Interleaved Learning)
    Ze laten de assistent niet eerst 100 keer "situatie herkennen" en daarna 100 keer "sturen". Ze wisselen het af: Een situatie herkennen, dan sturen, dan weer een situatie herkennen.
    Dit helpt de assistent om te begrijpen dat het herkennen van een gevaar direct gekoppeld is aan het vragen om hulp, en niet losstaat van het sturen.

  • Fase 3: De "Beloningssysteem" (GRPO)
    De assistent krijgt punten als hij goed doet:

    • +1 punt als hij goed zegt: "Dit is een gevaarlijke situatie!"
    • +1 punt als hij de juiste vraag stelt.
    • +1 punt als hij na jouw antwoord de juiste knop indrukt.
      Als hij fouten maakt (bijvoorbeeld door te gaan in een gevaarlijke situatie), krijgt hij geen punten. Zo leert hij snel wat belangrijk is.

3. De Nieuwe Testbaan (VeriOS-Bench)

Om te bewijzen dat hun assistent beter is, hebben ze een nieuwe testbaan gemaakt genaamd VeriOS-Bench.
Stel je voor dat ze een rijexamen hebben bedekt met valstrikken:

  • Een weg die plotseling wegvalt (een crash van het besturingssysteem).
  • Een bordje dat onduidelijk is (een vaag commando van de gebruiker).
  • Een gevaarlijke afslag (een gevoelige actie, zoals locatie delen).

De oude assistenten vielen hierin en vielen van de weg. VeriOS-agent zag de valstrikken, stopte, vroeg om instructies, en reed veilig verder.

Het Resultaat

De resultaten zijn indrukwekkend:

  • VeriOS-agent is 20% succesvoller in deze moeilijke, onzekere situaties dan de beste bestaande assistenten.
  • Het belangrijkste: Hij is niet trager in normale situaties. Als het weer mooi is en de weg helder, rijdt hij gewoon zo snel en efficiënt als de anderen.

Samenvatting

VeriOS is als het verschil tussen een roekeloze renner die overal doorheen rent en vaak struikelt, en een ervaren gids die weet wanneer hij moet stoppen om te kijken of de weg veilig is, en de reiziger om bevestiging vraagt voordat hij verder gaat.

Het maakt onze digitale assistenten niet alleen slimmer, maar vooral betrouwbaarder in de chaotische echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →