← Neueste Arbeiten
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

Dieses Paper stellt POINTS-GUI-G-8B vor, ein hochmodernes GUI-Grounding-Modell, das von einem Basismodell mit minimalem räumlichem Bewusstsein trainiert wurde, indem es durch verfeinertes Data-Engineering, verbesserte Trainingsstrategien und Reinforcement Learning mit verifizierbaren Belohnungen eine überlegene Leistung über mehrere Benchmarks hinweg erzielt.

Ursprüngliche Autoren: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Veröffentlicht 2026-02-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten Roboter-Assistenten, der Text lesen und Bilder ansehen kann. Sie möchten ihm beibringen, Ihren Computer oder Ihr Telefon zu benutzen, genau wie Sie es tun. Aber es gibt ein Problem: Der Roboter kann zwar die Anweisungen lesen („Klicken Sie auf den roten Button“), aber er weiß nicht, wo sich der rote Button tatsächlich auf dem Bildschirm befindet. Es ist, als würde man jemandem eine Karte einer Stadt geben, aber nicht sagen, in welcher Straße man sich gerade befindet.

Dieses Paper stellt POINTS-GUI-G vor, eine neue Version dieses Roboter-Assistenten, der endlich gelernt hat, auf einen Bildschirm zu schauen und zu sagen: „Ah, ich sehe den Button! Er ist genau dort bei diesen exakten Koordinaten.“

Hier ist die Erklärung, wie die Forscher diesen Roboter zum Meister des Bildschirms gemacht haben, erklärt durch einfache Analogien:

1. Der Ausgangspunkt: Eine leere Tafel

Die meisten anderen Forscher nahmen einen Roboter, der bereits gut darin war, Dinge zu finden (wie ein erfahrener Detektiv), und gaben ihm nur ein paar zusätzliche Hinweise. Die Autoren dieses Papers entschieden sich jedoch, mit einem Roboter zu beginnen, der schlecht darin war, Dinge zu finden. Sie wollten die Fähigkeit von Grund auf aufbauen, wie man einem Kind das Lesen beibringt, anstatt nur die Rechtschreibung eines Teenagers zu korrigieren. Sie begannen mit einem Basismodell namens „POINTS-1.5“, das fast keine Fähigkeit besaß, auf Dinge auf einem Bildschirm zu zeigen.

2. Die drei Säulen des Erfolgs

Um diesen „blinden“ Roboter in einen „sehenden“ zu verwandeln, verwendeten sie drei Hauptstrategien:

A. Die Lehrbücher säubern und ordnen (Verfeinerte Data Engineering)

Stellen Sie sich vor, Sie versuchen, einen Schüler mit einem Stapel von Lehrbüchern zu unterrichten. Einige Bücher verwenden Zoll, andere Zentimeter, einige sind auf Englisch und andere auf Französisch geschrieben. Einige Seiten sind zerrissen und andere sind mit Kritzeleien übersät. Es wäre ein Albtraum, daraus zu lernen.

Die Forscher taten drei Dinge, um dies zu beheben:

  • Standardisierung: Sie nahmen alle unordentlichen, unterschiedlichen Datensätze und zwangen sie in ein einziges Format. Jetzt wird jede „Koordinate“ (Position) auf die gleiche Weise gemessen, so als würde man alles in ein einheitliches Lineal umwandeln.
  • Rauschreduzierung: Sie agierten wie strenge Redakteure. Sie nutzten ein spezielles Werkzeug (genannt OmniParser-v2), um die Lehrbücher zu überprüfen. Wenn in einem Lehrbuch stand: „Der Button ist hier“, das Bild aber eindeutig zeigte, dass der Button ganz woanders war, warfen sie diese Seite raus. Sie behielten nur die perfekten Beispiele.
  • Es schwieriger machen: Sobald der Roboter gut darin wurde, große, offensichtliche Buttons zu finden, ließen die Forscher ihm „Hard Mode“-Rätsel. Sie erstellten Bildschirme mit winzigen, überfüllten Buttons und verwirrenden Layouts (wie ein unordentlicher Schreibtisch mit Papieren überall), um den Roboter zu schärferer Präzision zu zwingen.

B. Die Augen abstimmen (Verbesserte Trainingsstrategien)

Normalerweise werden bei der Ausbildung dieser KI-Modelle die „Augen“ (der Teil des Computers, der Bilder verarbeitet) festgeschrieben. Die Forscher erkannten, dass für das Finden von Buttons auf einem Bildschirm die Augen flexibel sein mussten.

  • Das Visuelle „entsperren“: Sie ließen die „Augen“ lernen und sich anpassen, während der Rest des Gehirns lernte. Dies ermöglichte es dem Roboter, feinere Details zu erkennen.
  • Konsistenz der Auflösung: Stellen Sie sich vor, Sie trainieren für ein Basketballspiel, indem Sie aus 1,5 Metern Entfernung Körbe werfen, aber dann erscheinen Sie zum echten Spiel, bei dem der Korb 3 Meter entfernt ist. Sie würden daneben werfen. Die Forscher stellten fest, dass ihr Roboter auf kleinen, niedrig aufgelösten Bildern übte, aber auf riesigen, hochauflösenden Bildschirmen getestet wurde. Sie behoben dies, indem sie den Roboter auf größeren, klareren Bildern trainierten, damit seine „Vision“ bereit für die Realität war.

C. Das Videospiel-Belohnungssystem (Reinforcement Learning)

Dies ist der einzigartigste Teil. Normalerweise wird Reinforcement Learning (RL) verwendet, um Robotern beizubringen, wie man denkt oder Logikrätsel löst. Hier nutzten sie es, um dem Roboter beizubringen, wie man sieht.

Denken Sie an ein Videospiel:

  • Der Roboter rät, wo ein Button ist.
  • Der Computer prüft: „Hast du den Button getroffen?“
  • Ja? +100 Punkte.
  • Nein? 0 Punkte.

Da die Antwort entweder richtig oder falsch ist (es gibt kein „vielleicht“), erhält der Roboter sehr klares Feedback. Die Forscher fanden heraus, dass diese „Versuchen, Punktzahl erhalten, wiederholen“-Schleife den Roboter viel genauer machte, als ihm lediglich Beispiele zu zeigen und zu sagen: „Das ist richtig“.

Das Ergebnis

Durch die Kombination dieser drei Methoden wurde das POINTS-GUI-G Modell zu einem Champion darin, Dinge auf Bildschirmen zu finden.

  • Es schlug viele andere Modelle, die viel größer und teurer waren.
  • Es erzielte unglaublich hohe Werte in Tests, die messen, wie gut ein Roboter Buttons, Texte und Icons auf Telefonen, Computern und Websites finden kann.

Kurz gesagt: Das Paper zeigt, dass man – wenn man seine Trainingsdaten säubert, das „visuelle System“ des Modells frei lernen lässt und ein striktes „Richtig-oder-Falsch“-Belohnungssystem nutzt – einen kleinen, effizienten Roboter bauen kann, der besser durch Ihren Computerbildschirm navigiert als viele riesige, teure Alternativen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →