VISTA: View-Consistent Self-Verified Training for GUI Grounding
VISTA ist ein auf GRPO basierendes Trainingsframework für das GUI-Grounding, das die Modellleistung und -robustheit verbessert, indem es Vergleichsgruppen aus mehreren zielerhaltenden Ansichten derselben Instanz konstruiert und einen selbstverifizierten Cross-View-Anker integriert, um die Koordinatengenerierung zu stabilisieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bringen einem Roboter bei, wie man auf Schaltflächen auf einem Computerbildschirm klickt. Die Aufgabe des Roboters besteht darin, einen Befehl wie „Klicke auf die Export-Schaltfläche“ zu hören und seine Maus an die exakt richtige Stelle zu bewegen.
Das vorliegende Paper stellt eine neue Trainingsmethode namens VISTA vor, die dem Roboter dabei hilft, viel besser darin zu werden. Um zu verstehen, warum VISTA besonders ist, müssen wir zuerst das Problem betrachten, das es löst.
Das Problem: Die „Immer die gleiche Ansicht“-Falle
Zuvor haben Forscher diese Roboter mit einer Methode namens GRPO trainiert. Stellen Sie sich GRPO wie einen Lehrer vor, der einem Schüler immer wieder exakt dasselbe Foto eines Computerbildschirms zeigt und ihn fragt, die Schaltfläche zu finden.
- Der einfache Fall: Wenn die Schaltfläche riesig und offensichtlich ist, bekommt der Schüler sie jedes Mal richtig. Der Lehrer denkt: „Großartig!“, aber es wird nichts Neues gelernt, da es keinen Unterschied zwischen den Versuchen gibt.
- Der schwierige Fall: Wenn die Schaltfläche winzig oder versteckt ist, verfehlt der Schüler sie jedes Mal. Der Lehrer denkt: „Oh nein“, lernt aber ebenfalls nichts Neues, da jeder Versuch auf die exakt gleiche Weise misslungen ist.
In beiden Fällen kann der Lehrer dem Schüler nicht sagen, wie er sich verbessern kann, weil es keine Variation im Feedback gibt. Es ist, als würde man versuchen, Tennis zu lernen, indem man 100 Mal denselben Ball an dieselbe Stelle schlägt; man lernt nie, wie man sich an einen beweglichen Ball anpasst.
Die Lösung: VISTA (Der „Zoomen und Zuschneiden“-Lehrer)
VISTA ändert das Spiel, indem es erkennt, dass eine Schaltfläche dieselbe Schaltfläche bleibt, egal aus welcher Perspektive man sie betrachtet. Anstatt dem Roboter immer wieder denselben vollständigen Bildschirm zu zeigen, erstellt VISTA mehrere verschiedene „Crops“ (vergrößerte oder verschobene Ansichten) desselben Bildschirms und stellt sicher, dass die Ziel-Schaltfläche immer sichtbar ist.
So funktioniert VISTA, erklärt anhand einer einfachen Analogie:
1. Die „Gruppenfoto“-Analogie (Ansichtskonsistente Gruppen)
Stellen Sie sich vor, Sie versuchen einem Freund beizubringen, ein bestimmtes rotes Auto auf einem Parkplatz zu finden.
- Der alte Weg: Sie zeigen ihm 8 Mal dasselbe Weitwinkelbild des gesamten Parkplatzes. Wenn er das Auto verpasst, verpasst er es 8 Mal. Wenn er es findet, findet er es 8 Mal. Es findet kein Lernen statt.
- Der VISTA-Weg: Sie zeigen ihm 8 verschiedene Fotos desselben Parkplatzes. In einigen ist die Kamera herangezoomt; in anderen ist sie nach links oder rechts verschoben. Das rote Auto ist in allen Bildern vorhanden, aber seine Position im Foto verändert sich.
- In einem Foto ist das Auto leicht zu entdecken.
- In einem anderen ist es teilweise durch einen Baum verdeckt.
- In einem dritten befindet es sich direkt in der Ecke.
Nun muss der Roboter herausfinden: „Okay, das Auto ist dasselbe, aber wo ist es in diesem speziellen Bild?“ Dies zwingt den Roboter, das Konzept der Schaltfläche zu lernen, anstatt nur eine einzige Koordinate auswendig zu lernen. Dies erzeugt eine „Gruppe“ von Antworten, bei denen einige richtig und einige falsch sind, was dem Lehrer nützliche Daten zur Verbesserung des Roboters liefert.
2. Das „Sicherheitsnetz“ (Selbstverifizierter Anker)
Es besteht das Risiko bei dieser neuen Methode: Wenn der Roboter durch die seltsamen Winkel der herangezoomten Fotos verwirrt wird, könnte er anfangen, wild zu raten und häufiger zu scheitern.
Um dies zu beheben, fügt VISTA einen Selbstverifizierten Anker hinzu. Betrachten Sie dies als ein Sicherheitsnetz, das erst dann ausfährt, wenn der Roboter bereit ist.
- Der Lehrer (der Computer) beobachtet die Versuche des Roboters.
- Wenn der Roboter es in keinem der 8 Fotos schafft, die Schaltfläche zu finden, unternimmt der Lehrer nichts. Er erzwingt die Antwort nicht, da der Roboter noch nicht bereit ist.
- Wenn der Robot jedoch es schafft, die Schaltfläche in mindestens einem der Fotos korrekt zu finden, sagt der Lehrer: „Aha! Du hast bewiesen, dass du es kannst!“
- Erst dann zeigt der Lehrer dem Roboter die „perfekte Antwort“ (die exakte Mitte der Schaltfläche) als stabilisierende Orientierungshilfe, um diesen Erfolg zu festigen.
Dies verhindert, dass der Roboter gezwungen wird, Antworten zu kopieren, die er noch nicht versteht, während es ihm gleichzeitig einen Schub gibt, wenn er zeigt, dass er dazu fähig ist.
Die Ergebnisse
Das Paper hat diese Methode auf mehreren Benchmarks getestet (wie ScreenSpot-Pro, ein schwieriger Test für das Finden kleiner Schaltflächen).
- Vor VISTA: Die Roboter (speziell die Qwen3-VL Modelle) bekamen etwa 55 % der schwierigen Klicks richtig.
- Nach VISA: Sie sprangen auf 63 % bis 67 % (je nach Modellgröße).
Das Paper stellt zudem fest, dass die Roboter dadurch „robuster“ wurden. Selbst wenn der Bildschirm während des Tests zugeschnitten oder aus einem seltsamen Winkel betrachtet wurde, war der Roboter weniger wahrscheinlich verwirrt oder neigte weniger dazu, seine Antwort zu „flippen“.
Zusammenfassung
VISTA ist eine intelligentere Art, eine KI darauf zu trainieren, auf Schaltflächen zu klicken. Anstatt die KI immer wieder an demselben statischen Bild üben zu lassen, lässt sie an vielen verschiedenen „Ansichten“ desselben Bildes üben. Sie gibt der KI den „Spickzettel“ (die perfekte Antwort) nur dann, wenn die KI bereits bewiesen hat, dass sie das Rätsel aus eigener Kraft lösen kann. Dies macht die KI intelligenter, anpassungsfähiger und besser darin, Schaltflächen auf unordentlichen, realen Computerbildschirmen zu finden.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.