← Nieuwste papers
💻 computer science

OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations

Dit artikel introduceert OmegaUse-SOP, een human-in-the-loop systeem dat expertdemonstraties transformeert naar herbruikbare, domeinspecifieke Standard Operating Procedure (SOP) vaardigheden voor GUI-agenten, wat hun betrouwbaarheid in complexe professionele omgevingen zoals fotovoltaïsche simulatiewerkstromen aanzienlijk verbetert.

Oorspronkelijke auteurs: Yixiong Xiao

Gepubliceerd 2026-08-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yixiong Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computerprogramma voor dat naar een scherm kan kijken, begrijpt wat het ziet en knoppen kan klikken of tekst kan typen net zoals een mens dat zou doen. Dit is de belofte van de "GUI-agent", een type kunstmatige intelligentie die is ontworpen om door de digitale wereld te navigeren, niet door code te lezen, maar door de grafische interfaces te bekijken en ermee te interageren die wij dagelijks gebruiken. Hoewel deze agenten behoorlijk goed zijn geworden in eenvoudige taken, struikelen ze vaak over complexe, professionele banen. Werk in de echte wereld verloopt zelden in een rechte lijn; het houdt verborgen regels, specifieke softwaregewoonten en stappen in die gecontroleerd en gecontroleerd moeten worden. Wanneer een agent probeert een professionele taak uit te voeren zonder deze nuances te begrijpen, raakt hij vaak de weg kwijt, mist hij een cruciaal detail of voert hij de verkeerde actie uit. De uitdaging is dan ook niet alleen om de agent slimmer te maken, maar om hem de specifieke, ongeschreven procedures te leren die experts gebruiken om het werk correct te volbrengen.

Een onderzoeker van Baidu en een bedrijf uit de elektrotechniek in China hebben een nieuw systeem ontwikkeld om dit probleem op te lossen, genaamd OmegaUse-SOP. De kern van het idee is om de manier waarop mensen complexe softwaretaken uitvoeren te behandelen als een reeks instructies die kunnen worden vastgelegd, verfijnd en hergebruikt. Ze noemen dit proces "SOP Engineering", wat staat voor Standard Operating Procedure Engineering (het ontwerpen van standaard werkprocedures). Denk aan het omzetten van de workflow van een meesterambachtslid in een betrouwbare gids die een machine kan volgen. In plaats van simpelweg een video op te nemen van iemand die op knoppen klikt, kijkt het systeem naar de menselijke expert, begrijpt wat diegene doet, en schrijft die acties vervolgens om naar duidelijke, logische stappen die een computer kan begrijpen en aanpassen aan nieuwe situaties.

Het systeem werkt via vier verschillende stadia die in een lus plaatsvinden. Eerst legt de "Observe"-module (waarnemen) vast hoe een menselijke expert een taak op een computer uitvoert. Het registreert elke muisklik, toetsaanslag en schermverandering, en slaat een afbeelding van het scherm op vlak vóór elke actie. Dit creëert een gedetailleerd logboek van precies wat er gebeurde en hoe het scherm er op dat moment uitzag. Vervolgens neemt de "Reason"-module (redeneren) dit ruwe logboek en vertaalt dit naar gewone taal. Het ziet een klik op een specifieke plek en begrijt dat de mens eigenlijk een veld voor de "projectnaam" selecteerde, en niet zomaar op een willekeurige coördinaat klikte. Het verandert een lijst met technische gebeurtenissen in een verhaal: "Klik op het projectnaamveld, typ vervolgens de naam." Deze stap is cruciaal omdat het de computer helpt de betekenis van de actie te begrijpen, en niet alleen de beweging.

Zodra de stappen begrepen zijn, stelt de "Configure"-fase (configureren) een menselijke gebruiker in staat om specifieke regels en variabelen toe te voegen. In professioneel werk moet dezelfde taak telkens uitgevoerd worden met verschillende getallen of instellingen. Deze module laat de gebruiker bepaalde delen van de instructies als veranderbaar markeren, zodat de agent weet welke waarden hij moet vervangen voor een nieuwe opdracht. Ten slotte zet de "Execute"-module (uitvoeren) het plan in actie. De agent bekijkt het huidige scherm, vindt de juiste stap in zijn instructies en voert de actie uit. Na elke stap controleert hij of het scherm veranderde zoals het had moeten gebeuren. Als er iets mis lijkt te gaan, kan hij stoppen en om hulp aan een mens vragen, of het opnieuw proberen. Deze cyclus van kijken, begrijpen, aanpassen en handelen verandert een enkele menselijke demonstratie in een herbruikbare vaardigheid die op veel verschillende taken kan worden toegepast.

Om te testen of deze aanpak daadwerkelijk werkt, is de onderzoeker een samenwerking aangegaan met een klant in de sector van de elektrotechniek om een zeer specifieke uitdaging aan te pakken: het ontwerpen van zonne-energiesystemen met behulp van een complex softwarepakket genaamd PVsyst. Ze kozen vijf moeilijke taken die experts regelmatig uitvoeren, zoals het importeren van weergegevens, het instellen van de hoek van zonnepanelen en het berekenen van energieverliezen. Ze testten drie verschillende modellen van kunstmatige intelligentie op deze taken. Eerst lieten ze de modellen de taken proberen te volbrengen door enkel naar een eenvoudige instructie te luisteren, zonder hulp van het nieuwe systeem. De resultaten waren gemengd; de modellen hadden aanzienlijke problemen en voltooiden slechts één tot drie van de vijf taken, afhankelijk van het gebruikte model. Ze raakten vaak in de war door de specifieke lay-out van de software of misten subtiele vereisten.

Vervolgens paste de onderzoeker het OmegaUse-SOP-systeem toe. Ze namen menselijke experts op die dezelfde vijf taken uitvoerden, gebruikten het systeem om deze opnames om te zetten in verfijnde, stapsgewijze vaardigheden, en lieten de modellen het opnieuw proberen. Het verschil was onmiddellijk en totaal. Met de hulp van de geëngineerde SOP's voltooide elk enkel model, inclus ook de open-source modellen, alle vijf de taken succesvol. Het systeem maakte de agenten niet slechts iets beter; het veranderde hen van onbetrouwbare beginners in competente operators. De onderzoeker voerde ook een specifieke test uit om te zien welk deel van hun systeem het belangrijkste was. Ze ontdekten dat de "Reason"-module, het deel dat ruwe klikken vertaalt naar betekenisvolle instructies, de sleutel was. Wanneer ze deze stap verwijderden en de agenten de ruwe, onverklaarde logs lieten volgen, daalde het succespercentage drastisch. Dit bewees dat het simpelweg opnemen van wat een mens doet niet genoeg is; de computer moet begrijpen waarom diegene het doet.

De bevindingen suggereren dat voor kunstmatige intelligentie om professionele software echt te beheersen, meer nodig is dan alleen krachtig visueel vermogen of geheugen. Het heeft een manier nodig om de impliciete kennis te vangen die menselijke experts bezitten — de gewoonten, de controles en de specifieke manieren waarop zij complexe menu's navigeren. Door een systeem te bouwen dat menselijke demonstraties kan omzetten in gestructureerde, bewerkbare en geverifieerde vaardigheden, heeft de onderzoeker een praktisch pad vooruit aangetoond. Het OmegaUse-SOP-systeem vervangt het menselijk oordeel niet; in plaats daarvan creëert het een brug tussen menselijke expertise en machinale uitvoering, waardoor computers de ingewikkelde, aan regels gebonden workflows kunnen afhandelen die de professionele werkzaamheden in velden zoals engineering en design definiëren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →