← Neueste Arbeiten
🤖 AI

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

Diese Arbeit zeigt, dass diskrete Diffusions-Vision-Language-Modelle durch die Einführung eines hybriden Maskierungsschemas und erweiterter Trainingsdaten eine vielversprechende, leistungsfähige Alternative zu autoregressiven Modellen für das Grounding von grafischen Benutzeroberflächen darstellen.

Ursprüngliche Autoren: Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

Veröffentlicht 2026-03-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ziel: Computer, die wie Menschen auf Bildschirme schauen

Stell dir vor, du möchtest deinem Computer sagen: „Klick auf den blauen Button" oder „Schreib 'Hallo' in das Suchfeld". Ein GUI-Agent ist ein digitaler Assistent, der genau das kann. Er muss nicht nur verstehen, was du sagst, sondern auch sehen, wo auf dem Bildschirm dieser Button oder dieses Feld ist.

Bisher haben die besten Computer-Modelle dafür wie ein Leser gearbeitet: Sie schauen sich das Bild an und schreiben die Antwort (z. B. die Koordinaten des Buttons) Wort für Wort, von links nach rechts. Das nennt man autoregressiv. Es ist wie ein Mensch, der einen Satz langsam aufschreibt.

Das neue Experiment: Ein Künstler, der alles auf einmal sieht

Die Forscher in diesem Papier haben etwas Neues ausprobiert. Statt eines Lesers haben sie einen Künstler genommen, der mit einer ganz anderen Technik arbeitet: dem Diffusionsmodell.

Die Analogie des Bildhauers:
Stell dir vor, du hast einen riesigen Block aus Marmor (das Bild des Bildschirms), auf dem alles verdeckt ist.

  • Der alte Leser (AR-Modell): Schaut sich den Block an und meißelt Stein für Stein heraus, bis das Bild fertig ist.
  • Der neue Künstler (Diffusionsmodell): Beginnt mit einem komplett vernebelten Block. Er schaut sich den Block an, wischt ein bisschen weg, schaut wieder hin, wischt mehr weg. Schritt für Schritt wird das Bild klarer, bis der Button sichtbar ist.

Der Vorteil des Künstlers ist, dass er den ganzen Block gleichzeitig betrachten kann (nicht nur von links nach rechts) und Fehler in der Mitte des Bildes später noch korrigieren kann, ohne alles neu schreiben zu müssen.

Das Problem: Der Künstler war etwas chaotisch

In der Anfangsphase war dieser „Künstler" (das Modell namens LLaDA-V) zwar gut im Verstehen von Sprache, aber beim Zeichnen von Rechtecken (den Buttons) etwas ungenau.

Das Problem:
Stell dir vor, der Künstler soll ein Rechteck zeichnen. Er muss zuerst den Startpunkt (oben links) und dann die Größe (wie weit es nach rechts und unten geht) bestimmen.
Das alte Modell hat dabei so getan, als wären alle Punkte völlig unabhängig voneinander. Es war, als würde es versuchen, die Ecken eines Hauses zu errichten, ohne zu wissen, dass die Wand, die die Ecken verbindet, gerade sein muss. Das führte zu krummen, ungenauen Rechtecken.

Die Lösung: Ein zweistufiger Bauplan (Hybrid-Masking)

Die Forscher haben dem Künstler einen neuen Bauplan gegeben, den sie „Hybrid-Masking" nennen. Das funktioniert wie ein zweistufiger Bauprozess:

  1. Phase 1: Der grobe Entwurf (Linear Masking)
    Der Künstler schaut sich das Bild an und bestimmt erst einmal grob: „Ah, da ist ein Suchfeld!" und markiert den Startpunkt (den Anker). Er darf hier noch etwas raten und korrigieren. Das ist wie das Aufstellen der Eckpfosten eines Zauns.

  2. Phase 2: Die feine Justierung (Deterministisches Masking)
    Jetzt, wo der Startpunkt feststeht, sagt das Modell: „Okay, der Startpunkt ist da. Jetzt zeichne ich nur noch die restlichen Ecken, die die Größe bestimmen."
    Der Clou: Der Künstler wird gezwungen, sich auf die Beziehung zwischen dem Startpunkt und dem Ende zu konzentrieren. Er muss nicht mehr raten, wo der Zaun beginnt, sondern nur noch, wie lang er ist.

Das Ergebnis:
Durch diesen zweistufigen Ansatz werden die Rechtecke viel präziser. Der Künstler macht weniger Fehler beim „Ausmessen" des Bildschirms.

Was haben sie herausgefunden?

  1. Es funktioniert! Der neue „Künstler" (Diffusionsmodell) ist fast so gut wie die alten „Leser" (AR-Modelle), obwohl er weniger Vorwissen hatte. Er kann Buttons finden und Aktionen ausführen.
  2. Mehr Daten = Besser: Wenn man dem Künstler viele verschiedene Bildschirme zeigt (nicht nur Webseiten, sondern auch Handy-Apps und Desktop-Programme), wird er schneller und genauer. Es ist, als würde man einem Maler viele verschiedene Landschaften zeigen, damit er lernt, wie Bäume, Häuser und Autos in jedem Kontext aussehen.
  3. Der Preis für Genauigkeit: Der neue Künstler braucht etwas mehr Zeit, um das Bild zu „verfeinern" (mehr Schritte), als der Leser, der einfach schnell von links nach rechts schreibt. Aber die Genauigkeit lohnt sich.

Fazit in einem Satz

Die Forscher haben gezeigt, dass man Computer nicht zwingen muss, Bildschirme wie ein Buch von links nach rechts zu lesen. Stattdessen kann man sie wie einen Künstler lehren, der erst grob skizziert und dann Schritt für Schritt verfeinert – und das führt zu smarteren digitalen Assistenten, die unsere Bildschirme wirklich verstehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →